arXiv論文メモ
新着一覧
eess.AS · 査読状況未確認

声の周期性を使い補助識別器なしで音質を改善するHAMMER

HAMMER: Harmonic-Aware Parallel Context Modeling and Discriminator-Free Perceptual Optimization for Speech Enhancement

Shang-Fu Chen, Szu-Wei Fu, Sung-Feng Huang, Rong Chao, Wen-Huang Cheng, and Yu Tsao

この論文をやさしく読む

ひとことで言うと

雑音の中の声をきれいにする際に、声の周期的な構造を明示的に使い、音質を採点する補助モデルを別に学習せずに改善する方法です。

何に役立つ?

考えられる用途は、音声通信や録音の雑音低減です。対象ベンチマークでは少ないパラメータ数で複数の音質指標を改善しています。

この研究の面白いところ

大域的な系列処理と局所的な周期性を組み合わせ、さらに評価指標の構造を損失へ直接取り入れます。推論時の追加処理でも再学習なしにPESQが上がると報告しています。

どこまで分かった?

数値はVoiceBank+DEMAND上の評価です。実環境全般や人による聴取評価の結果は要旨にありません。原文中の未展開の手法名マクロは、論文タイトルにあるHAMMERとして訳しています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

近年の音声強調システムは、自己注意とMambaを組み合わせ、大域的な相互作用と長距離依存を捉えている。しかし、これらの混成手法は通常、系列を混合する機構として動作し、雑音下で有声音を保つための強い手掛かりとなる倍音の周期性を明示的には利用しない。知覚品質の最適化も課題である。PESQは微分不可能なため、多くの手法は補助的な評価指標識別器を学習するが、複雑さが増し、敵対的学習の不安定性が生じる。 本研究では、倍音を考慮し、識別器を使わない音声強調手法HAMMERを提案する。二つの構成要素が中心となる。第一に、Time-Frequency Harmonic-aware Attention-Mamba(TF-HAM)ブロックは、スペクトログラムの両軸に沿って自己注意と双方向Mambaを並列に実行し、その後、音声に適応させた自己相関フィードフォワードネットワークを適用して局所的な周期構造を符号化する。第二に、評価指標を明示する知覚的改良(MEPR)は、微分可能なPESQ損失と対数尤度比損失を組み合わせ、学習した代理モデルを用いずに知覚指標の構造を表す。 VoiceBank+DEMANDで、HAMMERはわずか239万パラメータでPESQ 3.69、COVL 4.41を達成し、識別器に基づくシステムを上回るか同等となる。推論時の知覚コントラスト伸張により、再学習なしでPESQはさらに3.79へ上がる。ソースコードはhttps://github.com/shangfuu/HAMMER.gitで公開予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Recent speech enhancement systems combine self-attention and Mamba to capture global interactions and long-range dependencies. Yet these hybrids usually operate as sequence mixers and do not explicitly exploit harmonic periodicity, a strong cue for preserving voiced speech under noise. Perceptual optimization poses another challenge. PESQ is non-differentiable, so many methods train auxiliary metric discriminators that increase complexity and introduce adversarial instability. We propose \ours, a harmonic-aware and discriminator-free speech enhancer built around two components. (i) The Time-Frequency Harmonic-aware Attention-Mamba (TF-HAM) block runs self-attention and bidirectional Mamba in parallel along both spectrogram axes, then applies a speech-adapted autocorrelation feed-forward network to encode local periodic structure. (ii) Metric-explicit perceptual refinement (MEPR) combines differentiable PESQ and log-likelihood-ratio losses to expose perceptual metric structure without a learned surrogate. On VoiceBank+DEMAND, \ours achieves 3.69 PESQ and 4.41 COVL with only 2.39\,M parameters, outperforming or matching discriminator-based systems. Inference-time perceptual contrast stretching further raises PESQ to 3.79 without retraining. The source code will be available at https://github.com/shangfuu/HAMMER.git.

著者のコメント

1 page, 3 figures, accepted to ISCSLP 2026

arXiv ID: 2609.21171 / 要約の誤りについて