対になる音声データを使わない高速な音声強調
SE-MSB: End-to-End Unpaired Speech Enhancement using Mamba Schrödinger Bridges
この論文をやさしく読む
ひとことで言うと
きれいな音声と劣化音声を一対一でそろえずに学習し、速く音声を復元する方法。
何に役立つ?
対象環境の雑音を人工的に再現した対データを作りにくい場合の音声強調に役立つ可能性がある。
この研究の面白いところ
シュレーディンガー橋による分布間の輸送を、波形を扱うMamba拡散モデルで実装し、比較手法と同等以上の性能と大幅な推論高速化を報告した。
どこまで分かった?
要旨は推論が何桁も速いと述べるが、具体的な速度や音質指標は示していない。実環境全般での頑健性は要旨だけからは判断できない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声強調モデルは通常、きれいな音声を人工的に劣化させて作った対になるデータによる教師あり学習に依存する。この方式では、対象環境固有の音響特性が不明な現実の場面で性能が制約される。そこで本研究は、拡散に基づくシュレーディンガー橋(DSB)を用い、きれいな音声と劣化した音声の分布の間の確率的な輸送過程を学習する、完全に非対データの音声強調枠組みを提案する。輸送写像を学習するアルゴリズムは、通常、学習の各段階で微分方程式をシミュレーションするため計算負荷が高い。そこで、波形を端から端まで処理する高効率なMamba拡散モデルを使う。対データと非対データの両方を用いる最新の音声強調手法、および古典的な信号処理アルゴリズムと比較した。実験では、推論が何桁も速いにもかかわらず、比較手法と同等以上の性能を示した。さらに、DSBの定式化の柔軟性によって、モデルが複数の音声強調課題にまたがって一般化できることを示し、現実の音声復元に向けた頑健で効率的な解決法を提示した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Speech enhancement (SE) models typically rely on supervised learning with paired data examples where clean speech is synthetically degraded. This paradigm limits performance in real-world scenarios where the target environment's specific acoustic characteristics are unknown. We propose a fully unpaired SE framework that uses principled Diffusion Schrödinger Bridges (DSB) to learn a stochastic transport process between a clean and a degraded speech distribution. Algorithms for learning transport maps are computationally heavy since they require simulating differential equations during training, usually at each training step. Therefore, we propose using a high-efficiency Mamba Diffusion Model designed for end-to-end waveform processing. We compare against state-of-the-art methods for speech enhancement, both paired and unpaired, as well as a classical signal processing algorithm. Experimental results show that we are on par or better than the baselines while being orders of magnitude faster during inference. Furthermore, we show that the flexibility of the DSB formulation allows our model to generalize across SE tasks, offering a robust and efficient solution for real-world speech restoration.
著者のコメント
15 pages, 4 figures, 4 tables
arXiv ID: 2609.26000 / 要約の誤りについて