教師の採点結果を複数回の生徒更新に使う蒸留手法
CLOOPD: Closing the Learner Loop in On-Policy Distillation
この論文をやさしく読む
ひとことで言うと
教師モデルが一度採点したデータを、生徒モデルの更新に何度使うかを調整する手法です。教師の採点費用と生徒の学習計算量を分けて管理します。
何に役立つ?
教師の採点が高価な蒸留で、同じ教師信号をより有効に利用する設計に役立ちます。報告された条件では、少ない教師トークンと GPU 時間で基準手法に近い成績に達しました。
この研究の面白いところ
データを増やすだけでなく、一度得た信号を生徒がどれだけ取り込めたかを測り、追加更新を配分する点が特徴です。教師側の節約と生徒側の追加計算を区別しています。
どこまで分かった?
主な比較は8基の H20 上での6つの300ステップ実行です。67.2%と28.0%の削減は、CLOOPD の100ステップと TOP-D の300ステップの比較であり、同一ステップ数での削減率ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
オンポリシー蒸留(OPD)では、新しいバッチごとに、生徒が軌跡を生成する費用と、より強力な教師がそれを採点する費用の両方がかかる。既存手法は、採点する軌跡の選び方や教師信号の構成方法を改善しているが、通常はその信号をアクターの1回の更新で消費する。本研究では、教師信号の取得と、生徒側でその信号を学習に反映する過程を分離する閉ループの枠組み CLOOPD を導入する。CLOOPD は KL 制約範囲の内側で適応的な α の中間目標を選び、採点済みバッチとアドバンテージを固定する。各アクターパスの後に生徒の順伝播を再実行して学習の反映度を測り、別に設けたトークン予算の下でアクターの計算量を配分する。この枠組みには、決定的な2パス・3パス方策、トークン費用を考慮する CLOOPD-TPMR、予算を揃えた対照条件が含まれる。 H20 を8基搭載したノードで行った6つの300ステップ実行では、すべての CLOOPD 方策が、教師トークン数が同程度の条件で、1パスの基準手法 TOP-D を改善した。マクロ正解率は15.41から、CLOOPD-Fixed2 では17.78、CLOOPD-Fixed3 では19.36に上昇した。100ステップ時点で CLOOPD-Fixed3 は15.35に達し、300ステップ時点の TOP-D にほぼ並んだ一方、教師が採点したトークン数は67.2%、GPU 時間は28.0%少なかった。先行する A100 を8基用いたアブレーション実験では、適応的な α によって観測された信頼範囲の逸脱がなくなり、3回目のパスによって改善の余地が広がった。これらの結果は、教師が採点したトークンから生徒がどの程度十分に学ぶかに予算を配分する枠組みとして、CLOOPD を位置付けるものである。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
On-policy distillation (OPD) pays twice for each fresh batch: the student generates trajectories and a stronger teacher scores them. Existing methods improve which trajectories are scored and how the teacher signal is constructed, but usually consume it with one actor update. We introduce CLOOPD, a closed-loop framework separating teacher-signal acquisition from student-side realization. CLOOPD selects an adaptive $\alpha$ waypoint inside a KL envelope, freezes the scored batch and its advantages, re-forwards the student after each actor pass, measures realization, and allocates actor work under a separate token budget. The framework includes deterministic two- and three-pass policies, token-priced CLOOPD-TPMR, and a budget-matched control. Across six 300-step runs on an 8-H20 node, every CLOOPD policy improves the one-pass TOP-D anchor at comparable teacher-token scale: macro accuracy rises from 15.41 to 17.78 with CLOOPD-Fixed2 and 19.36 with CLOOPD-Fixed3. At step 100, CLOOPD-Fixed3 reaches 15.35, nearly matching TOP-D at step 300 while using 67.2% fewer teacher-scored tokens and 28.0% fewer GPU-hours. Earlier 8-A100 ablations show adaptive $\alpha$ eliminates observed trust-envelope violations; a third pass adds headroom. These results position CLOOPD as a framework for budgeting how fully students learn from teacher-scored tokens.
arXiv ID: 2609.24141 / 要約の誤りについて