音声認識と質問応答の両立を狙う蒸留法
TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation
この論文をやさしく読む
ひとことで言うと
音声認識を強化すると質問応答が弱くなる問題を、タスクごとに教師を分ける蒸留で抑えた。
何に役立つ?
音声言語モデルで文字起こしと質問応答の両方を維持する学習方法の検討に役立つ。
この研究の面白いところ
特化前後のモデルを別の教師として使い、生徒がタスク別の生成過程で学ぶ。
どこまで分かった?
要旨には具体的な改善量や評価データセットの詳細は示されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声言語モデル(SLM)は事前学習した言語モデルから強い指示追従能力を引き継ぐが、音声認識(ASR)に特化すると、その能力が大きく低下しうる。このASRと質問応答(QA)のトレードオフに対し、著者らはタスク別の方策上蒸留TS-OPDを提案する。ASR特化の前後のモデルを、補完的なQA教師とASR教師として使う。生徒モデルはASR用とQA用に条件付けられた別々の生成過程を作り、それぞれ対応する教師からだけ教師信号を受ける。これにより、2種類の教師信号の直接的な競合を減らす。基本的なASR、文脈を使うASR、QAでの実験では、QA能力を保ちながら認識性能を改善した。また、タスク間の重みの係数を変えても頑健で、蒸留データを増やすとさらに性能が向上した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Speech Language Models (SLMs) inherit strong instruction-following capabilities from pretrained language models, yet ASR specialization can substantially degrade them. To address this ASR--QA trade-off, we propose Task-Specific On-Policy Distillation (TS-OPD), which leverages models before and after ASR specialization as complementary QA and ASR teachers. The student generates separate task-conditioned trajectories for ASR and QA, each supervised only by its corresponding teacher, thereby reducing direct competition between the two supervision signals. Experiments on basic ASR, contextual ASR, and QA demonstrate that TS-OPD improves recognition while preserving QA capability. Moreover, TS-OPD remains robust across different balancing coefficients and continues to benefit from increased distillation data.
arXiv ID: 2609.29464 / 要約の誤りについて