arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

自己蒸留で、教師に解答を見せる追加効果はどれほどか

What Does Privileged Information Add to On-Policy Self-Distillation?

XiuYu Zhang, Wei Chow, Junfeng Fang, Xingyu Zhu, Zhenkai Liang, Tat-Seng Chua

この論文をやさしく読む

ひとことで言うと

教師に正解や解法を与える効果と、自己蒸留そのものの効果を分けて調べた研究です。改善の多くが参照解答なしでも得られる場合がありました。

何に役立つ?

自己蒸留の設計で、解答情報を追加する価値や、生徒が生成する推論の長さを検討する材料になります。

この研究の面白いところ

教師に多くの解法を見せれば必ず良くなるわけではありません。生徒の生成を長い思考付きに変えるだけで、同条件での改善が悪化に変わった点が重要です。

どこまで分かった?

Qwen3-1.7BとSmolLM3-3Bの実験条件に依存する結果です。既存の推論能力を引き出すという説明は知見からの示唆であり、自己蒸留一般の機構を完全に証明したものではありません。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

オンポリシー自己蒸留(OPSD)では、言語モデルは解答や解法を見られる凍結した自分自身のコピーから学習する。教師にこうした追加情報を与えると、生徒が学べることも増えるように見えるが、蒸留そのものに比べてどれほど上乗せになるのだろうか。この寄与を切り分けるため、同じ解答を共有する六つの推論表現を持つ5,319の数学問題からなる、再利用可能な評価スイートAMPLE-Mathを構築し、各表現を、条件をそろえた参照解答なしの蒸留と比較する。 思考モードを有効にした教師が直接回答のロールアウトを指導するとき、Qwen3-1.7Bを思考モード有効で評価した改善の多くは、領域内と外部ベンチマークの両方で、参照解答なしの蒸留によって説明される。参照情報の追加効果を支持する証拠はQwenでは控えめで、整えられた解法で最も強かった。一方、SmolLM3-3Bでは完全な推論過程が、ステップ50で2パーセントポイントの上乗せをもたらした。これらの効果は、学習する生徒の条件に依存する。同じチェックポイントで、問題、参照情報、評価を固定したまま、短い直接回答のロールアウトを長い思考モード付きのロールアウトに置き換えると、両モデル群で改善が悪化へ転じた。 さらにQwenでは、教師の特性分析と、条件をそろえた損失への介入により、トークン単位の教師信号を変えても、生徒の振る舞いがほぼ変わらない場合があることが示された。これらの知見は、OPSDが、直接回答と思考モード付き推論で共有するパラメータを通じて、すでにある推論能力を引き出しやすくする可能性を示唆する。教師だけが利用できる参照情報の価値は、解法をどれだけ明かすかではなく、このモード間の転移に何を付け加えるかにある。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-18 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

On-policy self-distillation (OPSD) lets a language model learn from a frozen copy of itself that sees an answer or a worked solution. Giving the teacher this extra information seems to offer the student more to learn, but how much does it add beyond distillation itself? To isolate that contribution, we construct AMPLE-Math, a reusable suite of 5,319 mathematical problems with six reasoning views that share the same answer, and compare each view with matched reference-free distillation. With a thinking-enabled teacher supervising direct-response rollouts, reference-free distillation accounts for much of Qwen3-1.7B's improvement under thinking-enabled evaluation, both in domain and on external benchmarks. Evidence for an additional reference benefit is modest in Qwen, strongest for a polished solution, whereas complete traces add two percentage points in SmolLM3-3B at step 50. These benefits depend on the student being trained. At the same checkpoint, replacing short direct-response rollouts with long thinking-enabled rollouts turns gains into losses in both families while the problems, references, and evaluation stay fixed. Teacher profiles and matched loss interventions in Qwen further show that changing token-level supervision can leave student behavior largely unchanged. Together, these findings suggest that OPSD can improve access to existing reasoning capabilities through parameters shared by direct-response and thinking-enabled inference. The value of a privileged reference is what it adds to this cross-mode transfer, not how much of the solution it reveals.

arXiv ID: 2609.20612 / 要約の誤りについて