複数教師からの蒸留で勾配と重み更新がどう変わるか
From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation
この論文をやさしく読む
ひとことで言うと
複数の教師モデルから学ぶとき、教師が出す勾配が実際の重みや課題成績にどう反映されるかを調べています。平均化、最適化器、数値精度を切り分けます。
何に役立つ?
蒸留の方式を比べる際、見かけの勾配差や保存重みの差だけで判断しないための手掛かりになります。特に応答の長さによる暗黙の重み付けを確認できます。
この研究の面白いところ
FP32では多くの重みが変化しても、BF16では丸めで変化が見えにくくなります。また、勾配がよく似る近似でも、平均化規則によって数学成績の改善・悪化が逆転します。
どこまで分かった?
主な対象は同じ初期状態を共有する4教師とQwen3-1.7Bで、SmolLM3-3Bは追加診断です。0.83と0.96は更新の類似度で、正答率ではありません。異なる初期モデルからの教師統合への一般化は要旨からは分かりません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
複数教師によるオンポリシー蒸留(MOPD)は、強化学習(RL)で学習した複数教師の強みを1つの生徒モデルへ統合することを目指すが、教師の信号がパラメータ変化へどう影響するかは十分に研究されていない。私たちは、生徒と同じ初期状態からRLで学習した4つの分野別教師を用いるQwen3-1.7Bを調べ、勾配、最適化器の更新、課題ごとの学習曲線を比較する。SmolLM3-3Bでも追加の診断を行う。 教師の信号には複数の要因が影響する。第一に、損失の平均化は暗黙に応答を重み付けする。トークン単位の平均化では長い応答が優先され、分野の寄与を均等にしても、分野内ではこの重み付けが残る。第二に、Adamの一次モーメントはパラメータ更新の違いを小さくする。生の勾配には違いがあっても、更新のコサイン類似度は教師間で0.83、平均化規則間で0.96となる。第三に、BF16の丸めは小さな変化を見えなくする。FP32のマスター重みでは約97%が初期値から変わっているが、BF16の重みでは7〜11%しか変わっていない。 最後に、上位64候補の共通部分を使うKL勾配はQwenの全語彙の勾配によく一致するが、課題性能への影響は平均化方法に依存する。数学の正答率は、応答単位の平均化ではサンプルされたトークンを使う方策勾配(PG)より2.6ポイント高い一方、全体のトークン平均化では2.1ポイント低い。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Multi-teacher on-policy distillation (MOPD) aims to combine the strengths of RL-trained teachers in a single student, but how teacher signals affect parameter changes remains underexplored. We study Qwen3-1.7B with four domain teachers trained with RL from the same initialization as the student, comparing gradients, optimizer updates, and task learning curves, with additional SmolLM3-3B diagnostics. We find that several factors influence teacher signals. First, loss averaging implicitly weights responses: token averaging favors longer responses, and equalizing domain contributions retains this weighting within domains. Second, Adam's first moment reduces differences in parameter updates: the cosine similarity is 0.83 between teachers and 0.96 between averaging rules, despite differences in raw gradients. Third, BF16 rounding hides small changes: about 97\% of FP32 master weights differ from initialization, but only 7--11\% of BF16 weights do. Finally, the top-64 intersection KL gradient closely matches Qwen's full-vocabulary gradient, but the effect on task performance depends on averaging: mathematics accuracy is 2.6 points higher than with sampled-token policy-gradient (PG) under response averaging and 2.1 points lower under global token averaging.
arXiv ID: 2610.02179 / 要約の誤りについて