音声強調モデルを自分の生成途中の誤りから追加学習する
Corrective Forcing: Unified Post-Training for Diffusions and Flows in Generative Speech Enhancement
この論文をやさしく読む
ひとことで言うと
雑音を減らして音声を復元するモデルに、理想的な途中状態だけでなく、自分で生成した誤りを含む途中状態からも修正を学ばせます。
何に役立つ?
推論を繰り返すうちに誤差が積み重なる問題を減らすための方法です。音声の聞こえ方と元の音声への忠実さについて改善を報告しています。
この研究の面白いところ
拡散モデルとフローモデルを、クリーン音声を予測する共通の形式で扱います。推論ステップ数などが変わる条件を追加学習へ組み込んでいます。
どこまで分かった?
評価はSB-VEとOT-CFMについて述べられており、具体的な改善値、データセット、計算費用は要旨にありません。どの音声環境や生成モデルでも同じ効果が出るとは確認できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声強調の有望な生成方式である拡散モデルとフローモデルには、学習時と推論時の不一致がある。学習には解析的な経路上の状態を使う一方、推論では離散化したサンプリング軌跡に沿って自ら生成したロールアウト状態でモデルを再帰的に評価する。この不一致により、予測誤差と離散化誤差が蓄積する。 これに対処するため、拡散モデルとフローモデルが自ら生成したロールアウトから学び、予測を修正するようにする追加学習方式、Corrective Forcing(CoF)を導入する。CoFは、動的なサンプリングスケジュールのもとで、ロールアウト状態におけるクリーン音声の予測を正解へ向けて修正し、モデルをさまざまな推論条件にさらす。さらに、局所的に修正した反実仮想の遷移を、実際の遷移に対する参照として使い、局所的な変化を正則化する。 モデル出力を共通のクリーン音声予測のパラメータ化で表すことにより、CoFは拡散とフローの定式化に同じ追加学習目的を適用する。SB-VEとOT-CFMを用いた実験では、知覚的な品質と再構成の忠実度が改善し、サンプリングのステップ数を変えても頑健な性能を示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Diffusion and flow models, as promising generative paradigms for speech enhancement, face a training--inference mismatch: training uses analytical path states, whereas inference recursively evaluates models on self-generated rollout states along discretized sampling trajectories. This mismatch causes prediction and discretization errors to accumulate. To address it, we introduce Corrective Forcing (CoF), a post-training paradigm that forces diffusion and flow models to learn from self-generated rollouts and correct their predictions. CoF corrects clean-speech predictions on rollout states toward the ground truth under dynamic sampling schedules, exposing the model to varying inference conditions. It further regularizes local evolution using locally corrected counterfactual transitions as references for factual transitions. By expressing model outputs through a shared clean-speech prediction parameterization, CoF applies the same post-training objective across diffusion and flow formulations. Experiments with SB-VE and OT-CFM demonstrate improvements in perceptual quality and reconstruction fidelity, together with robust performance across different numbers of sampling steps.
著者のコメント
Submitted to ICASSP 2027
arXiv ID: 2609.24651 / 要約の誤りについて