音声の証拠を重視する音声言語モデルの蒸留法
Reward-Tilted On-Policy Distillation for Acoustic Grounding in Audio-Language Models
この論文をやさしく読む
ひとことで言うと
音声を聞かずに文章から答える近道を減らすため、音声の有無で教師モデルの予測が変わる部分を重視する学習法。
何に役立つ?
小型の音声言語モデルが実際の音響情報を使って答えるよう訓練する際の手法として役立つ。
この研究の面白いところ
同じ文に音声を添えた場合と添えない場合の次トークン確率差を学習の重みに使った。
どこまで分かった?
評価は二つの小型モデルと三つのベンチマークで行われた。無音・置換実験は音声依存の強化を示唆するが、全状況で保証するものではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声言語モデルは音響的な証拠を見落とし、文章だけから答えを推測する近道を使うことがある。これにより音声理解が弱まる。オンポリシー蒸留(OPD)は、生徒モデルが生成した応答に教師モデルの予測を使って小型の音声言語モデルを訓練するが、音声から得た根拠と、言葉として予測しやすいだけの内容を明示的に区別しない。そこで音響的根拠への依存を強めるため、報酬で重みを傾けるオンポリシー蒸留RT-OPDを提案する。同じ質問と生徒モデルが生成した文に対し、固定した教師モデルが、音声入力ありとなしの両条件で次のトークンを予測する。両者の対数確率の差を報酬とし、逆KLによる蒸留に用いる教師の分布を変形して、音声が追加で与える証拠を重視する。 二つの小型生徒モデルと三つのベンチマークを通じて、RT-OPDは通常のOPDを一貫して上回った。音声を無音にする実験と別の音声に置き換える実験も、生徒モデルが音響的な証拠により依存するようになったことを示唆する。30億パラメータのモデルはMMAUで72.72%の正答率を達成し、比較した同規模のモデルの中では最高で、70億・80億パラメータの複数のモデルとも競合した。コードとモデルのチェックポイントは https://github.com/KaiyangLi1992/RT-OPD で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Audio-language models (ALMs) can exploit textual shortcuts to answer questions while overlooking acoustic evidence, weakening audio understanding. On-policy distillation (OPD) trains compact ALMs by supervising student-generated responses with teacher predictions, but does not explicitly distinguish acoustic support from linguistic predictability. We propose Reward-Tilted On-Policy Distillation (RT-OPD) to strengthen acoustic grounding. Given the same question and student-generated text, a frozen teacher predicts the next token with and without audio inputs. Their log-probability contrast defines a reward that reshapes the teacher distribution for reverse-KL distillation, emphasizing the additional evidence provided by audio. Across two compact students and three benchmarks, RT-OPD consistently outperforms Vanilla OPD. Experiments with silenced and replacement audio further suggest that RT-OPD strengthens the student's reliance on acoustic evidence. Our 3B model achieves 72.72% accuracy on MMAU, the highest among the compared 3B models and competitive with several 7B and 8B models. Code and model checkpoints are available at https://github.com/KaiyangLi1992/RT-OPD.
著者のコメント
5 pages, submitted to ICASSP 2027
arXiv ID: 2609.28778 / 要約の誤りについて