教師モデルと正誤判定を統合する数理推論の学習法
When and Where to Trust the Teacher: Unifying On-Policy Distillation and GRPO through Entropy-Calibrated Credit Assignment
この論文をやさしく読む
ひとことで言うと
最終解答の正誤と教師モデルの評価を合わせ、数理推論モデルの各応答・各トークンへの学習信号を配分する方法。
何に役立つ?
考えられる用途は、検証可能な答えを持つ数理推論課題でのモデル学習。要旨では5つのベンチマークで比較手法より小幅な正答率向上を報告する。
この研究の面白いところ
教師の評価をグループ正規化前に組み込み、教師が不確かなトークンへの重みを抑えながら、応答全体に割り当てた課題評価の総量を保つ。
どこまで分かった?
報告された成績はQwen3の2つの生徒モデルと5つの数理推論ベンチマークに対するもの。教師の好みが常に正しさを表すとは限らないという問題を出発点としている。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
検証可能な報酬を使う強化学習(RLVR)は、最終解答の正しさによって数理推論を指導できるが、個々のトークンにはほとんど指針を与えない。方策に沿った蒸留(OPD)は、生徒モデル自身が生成した応答に密なフィードバックを与えるものの、教師モデルの好みが正しさを反映するとは限らない。最近の混合手法はOPDと検証器から得たアドバンテージを組み合わせたり、教師との比率に基づいて課題の評価を重み付けし直したりする。しかし、教師の指針が検証器に基づくグループ正規化の後から入ることや、トークンへの再重み付けで応答ごとの課題評価の総量が保たれないことがある。 本研究は、応答とトークンの両水準で、検証器と教師モデルの信号を単一のGRPO型更新に統合するUnified Entropy-Calibrated Credit Redistribution for GRPO(UECR-GRPO)を提案する。Path-Utility Unification(PUU)は、検証器の報酬と、教師からアンカーモデルへの経路の対数比を、KL正則化された単一の目的関数にまとめる。方策に沿った実装では、長さで正規化した教師スコアを使い、両方の報酬をグループ正規化とPPOのクリッピングより前に組み合わせることで、教師の情報が応答の順位に影響できるようにする。Entropy-Calibrated Redistribution(ECR)は、教師と旧方策のトークン確率の符号付き差を使い、検証器由来の評価分を再配分する。全語彙に対する教師のエントロピーによって不確かな指針の重みを下げ、応答ごとの総和をゼロにする射影によって、クリッピング前の課題評価総量とトークンごとの符号を保つ。5つの数理推論ベンチマークで、UECR-GRPOの平均Avg@12正答率は、Qwen3-1.7Bを生徒とした場合17.21%、Qwen3-4Bでは65.09%となり、それぞれの規模で最も強い比較手法を0.89ポイント、0.56ポイント上回った。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Reinforcement learning with verifiable rewards (RLVR) supervises mathematical reasoning through final-answer correctness, but provides little guidance on individual tokens. On-policy distillation (OPD) supplies dense feedback on student-generated responses, yet teacher preference need not reflect correctness. Recent hybrids combine OPD and verifier-derived advantages or reweight task credit using teacher ratios. However, teacher guidance enters after verifier-based group normalization, and token reweighting need not preserve the total task credit assigned to each response. We introduce Unified Entropy-Calibrated Credit Redistribution for GRPO (UECR-GRPO), which integrates verifier and teacher signals within a single GRPO-style update at both the response and token levels. \emph{Path-Utility Unification} (PUU) combines verifier reward and a teacher-to-anchor path log-ratio in a single KL-regularized objective. Its on-policy implementation uses a length-normalized teacher score and combines both rewards before group normalization and PPO clipping, allowing teacher evidence to influence the response ranking. \emph{Entropy-Calibrated Redistribution} (ECR) then uses the signed teacher--old-policy token gap to redistribute the verifier-derived component. Full-vocabulary teacher entropy attenuates uncertain guidance, while a response-wise zero-sum projection preserves the total task credit and its token-wise sign before clipping. Across five mathematical reasoning benchmarks, UECR-GRPO achieves average \(\mathrm{Avg@12}\) accuracies of 17.21\% and 65.09\% with Qwen3-1.7B and Qwen3-4B students, respectively, exceeding the strongest baseline at each scale by 0.89 and 0.56 percentage points.
arXiv ID: 2609.28385 / 要約の誤りについて