arXiv論文メモ
新着一覧
cs.SD · 掲載先の記載あり

複数の音声符号化を学習に使い単一符号器の認識を改善

Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

Paul Moïse Gangbadja and Mickael Rouvier and Fabrice Lefèvre

この論文をやさしく読む

ひとことで言うと

同じ音声を複数のエンコーダで別々のトークン列に変換し、共通の言語モデルに学習させます。学習で表現の種類を増やし、テスト時には一つのエンコーダでも認識できる方法です。

何に役立つ?

考えられる用途は、推論時のエンコーダ数を増やさずにLLMを使う音声認識を改善することです。LibriSpeechでの単語誤り率により効果を評価しています。

この研究の面白いところ

異なるエンコーダの出力を同時に融合するのでなく、同じ発話の別の学習表現として利用します。予算をそろえた比較で、単に学習データ量が増えた効果との切り分けも行っています。

どこまで分かった?

3.30%・8.13%はWavLMでの値で、3.03%・7.38%は複数視点の認識候補をROVERで統合した別の条件です。後者を単一エンコーダだけの結果として扱うことはできません。要旨の評価対象はLibriSpeechで、他言語の数値はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

離散音声トークンは、自動音声認識において音声エンコーダと大規模言語モデル(LLM)をつなぐコンパクトなインターフェースとなる。しかし、一つのトークン化だけを用いるシステムは、選んだエンコーダの影響を受けやすい。本研究では、HuBERT、WavLM、MMS-300Mなどの固定された自己教師あり学習(SSL)エンコーダから別々のトークン列を生成し、各学習発話を増強する簡単な戦略、複数視点の離散トークン拡張を提案する。 これらのトークン化を、共通のLLMデコーダに対する相補的な学習視点として扱う。これにより、推論時に複数エンコーダを必要とすることなく、より多様な離散音声表現をデコーダに提示する。テスト時には単一エンコーダで動作できる。LibriSpeechでは、独立に学習した基準モデルと比べて、すべてのエンコーダで一貫した改善が得られた。WavLMではtest-cleanの単語誤り率(WER)が3.30%、test-otherが8.13%となった。 予算をそろえた対照実験から、改善はデータ量ではなくエンコーダの多様性に由来することが示された。複数視点の認識候補にROVERを適用すると、WERはさらに3.03%と7.38%へ改善した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
掲載先の記載あり

著者による掲載先の記載:IEEE SLT 2026。出版社での独立確認は未実施です。

arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Discrete speech tokens provide a compact interface between speech encoders and large language models for automatic speech recognition, but single-tokenization systems remain sensitive to the chosen encoder. We propose multi-view discrete token augmentation, a simple strategy that augments each training utterance by generating alternative token sequences from fixed SSL encoders, such as HuBERT, WavLM, and MMS-300M. These tokenizations are treated as complementary training views for a shared LLM decoder, exposing it to more diverse discrete speech representations without requiring multi-encoder inference. At test time, the model can operate with a single encoder. On LibriSpeech, the approach consistently improves all encoders over independently trained baselines, with WavLM reaching 3.30% WER on test-clean and 8.13% on test-other. Budget-matched controls show that the gains come from encoder diversity rather than data volume. ROVER over multi-view hypotheses further improves WER to 3.03% and 7.38%.

arXiv ID: 2609.23525 / 要約の誤りについて