複数の音声符号化を学習に使い単一符号器の認識を改善
Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR
この論文をやさしく読む
ひとことで言うと
同じ音声を複数のエンコーダで別々のトークン列に変換し、共通の言語モデルに学習させます。学習で表現の種類を増やし、テスト時には一つのエンコーダでも認識できる方法です。
何に役立つ?
考えられる用途は、推論時のエンコーダ数を増やさずにLLMを使う音声認識を改善することです。LibriSpeechでの単語誤り率により効果を評価しています。
この研究の面白いところ
異なるエンコーダの出力を同時に融合するのでなく、同じ発話の別の学習表現として利用します。予算をそろえた比較で、単に学習データ量が増えた効果との切り分けも行っています。
どこまで分かった?
3.30%・8.13%はWavLMでの値で、3.03%・7.38%は複数視点の認識候補をROVERで統合した別の条件です。後者を単一エンコーダだけの結果として扱うことはできません。要旨の評価対象はLibriSpeechで、他言語の数値はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
離散音声トークンは、自動音声認識において音声エンコーダと大規模言語モデル(LLM)をつなぐコンパクトなインターフェースとなる。しかし、一つのトークン化だけを用いるシステムは、選んだエンコーダの影響を受けやすい。本研究では、HuBERT、WavLM、MMS-300Mなどの固定された自己教師あり学習(SSL)エンコーダから別々のトークン列を生成し、各学習発話を増強する簡単な戦略、複数視点の離散トークン拡張を提案する。 これらのトークン化を、共通のLLMデコーダに対する相補的な学習視点として扱う。これにより、推論時に複数エンコーダを必要とすることなく、より多様な離散音声表現をデコーダに提示する。テスト時には単一エンコーダで動作できる。LibriSpeechでは、独立に学習した基準モデルと比べて、すべてのエンコーダで一貫した改善が得られた。WavLMではtest-cleanの単語誤り率(WER)が3.30%、test-otherが8.13%となった。 予算をそろえた対照実験から、改善はデータ量ではなくエンコーダの多様性に由来することが示された。複数視点の認識候補にROVERを適用すると、WERはさらに3.03%と7.38%へ改善した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 掲載先の記載あり
著者による掲載先の記載:IEEE SLT 2026。出版社での独立確認は未実施です。
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Discrete speech tokens provide a compact interface between speech encoders and large language models for automatic speech recognition, but single-tokenization systems remain sensitive to the chosen encoder. We propose multi-view discrete token augmentation, a simple strategy that augments each training utterance by generating alternative token sequences from fixed SSL encoders, such as HuBERT, WavLM, and MMS-300M. These tokenizations are treated as complementary training views for a shared LLM decoder, exposing it to more diverse discrete speech representations without requiring multi-encoder inference. At test time, the model can operate with a single encoder. On LibriSpeech, the approach consistently improves all encoders over independently trained baselines, with WavLM reaching 3.30% WER on test-clean and 8.13% on test-other. Budget-matched controls show that the gains come from encoder diversity rather than data volume. ROVER over multi-view hypotheses further improves WER to 3.03% and 7.38%.
arXiv ID: 2609.23525 / 要約の誤りについて