arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

音声トークンモデルの短文から長文への学習効果を分解する

Rethinking Length-Based Training: Batch Composition and Loss Normalization in Speech Token Language Models

Hongjin Song, Runwu Shi, Weiqiao Shan, Jiale Luo, Yujin Wang, Yifei Wu, Chunxiang Jin

この論文をやさしく読む

ひとことで言うと

短い音声系列から長い系列へ学習する方法の改善が、順序そのものかバッチと損失の設定によるものか切り分けた。

何に役立つ?

音声モデルの訓練法を比較するとき、系列長以外の条件をそろえて効果を評価する指針になる。

この研究の面白いところ

同じトークンとバッチ構成なら学習順序の独立した利点は見られず、損失の正規化を変えると改善も消えた。

どこまで分かった?

結論は要旨で示された試験条件に関する。あらゆる音声モデルで長さ順の学習が無効だとは述べていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

短い系列から長い系列へ進む学習は音声モデルの単純なカリキュラムだが、その効果は解釈しにくいことがある。音声トークンの言語モデルでは、長さに基づく学習によって、データのシャッフル方針、バッチの構成、保持するトークン、バッチ平均損失におけるトークンの重みが変わり得る。著者らは条件を合わせた比較により、これらの要因を切り分けた。試験した条件では、バッチ構成と見せるトークンを固定すると、短い系列から長い系列へ進める順序そのものに独立した利点はなかった。最初のエポックでの系列のグループ化は、バッチ平均損失の下ではMimiのパープレキシティを下げたが、トークン間で重みを均等にした損失の下では改善が見られなかった。異なるトークナイザー間の結果は、チャンク長の変動とトークンの重み付けの関係と整合する。この研究は、長さがさまざまな音声モデルで、長さに基づく学習を調べるための系統的な分析手順を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Short-to-long training is a simple curriculum for speech models, but its gains can be difficult to interpret. In speech token language models, length-based training can change the shuffle policy, batch composition, token retention, and token weights under batch-mean loss. We disentangle these factors through matched comparisons. In the tested settings, short-to-long ordering shows no independent benefit when batch composition and token exposure are fixed. First-epoch grouping lowers perplexity for Mimi under batch-mean loss, but this gain is not observed under token-balanced loss. The cross-tokenizer results are consistent with a link between chunk-length variation and token weighting. This work provides a systematic analysis protocol for studying length-based training in variable-length speech models.

arXiv ID: 2609.25890 / 要約の誤りについて