好ましい応答と勾配が揃うトークンへの罰を弱める学習
GAW-PO: Preference Optimization with Gradient-Aligned Token Weights
この論文をやさしく読む
ひとことで言うと
選ばれなかった回答でも、役に立つ部分まで一律に罰しないよう、トークンごとの勾配の向きを使って学習の重みを変える方法です。
何に役立つ?
言語モデルを好ましい回答へ調整するDPOの改善に役立ちます。11ベンチマークの平均性能と、正則化を弱めた際の挙動で効果を評価しています。
この研究の面白いところ
回答全体への「不採用」という評価を、その中の各トークンに同じように与えません。好ましい更新と同じ方向を向く部分を見分け、そこへの負の更新を弱めます。
どこまで分かった?
0.97ポイントと0.65ポイントは、評価した11ベンチマークにわたる性能差です。要旨にはモデル規模や追加計算量、各ベンチマークでの個別の差は記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
直接選好最適化(DPO)など、多くの選好最適化手法は、自己回帰型言語モデルをトークンごとに最適化するにもかかわらず、応答全体の単位で選好による教師信号を与える。その結果、選ばれなかった応答のすべてのトークンが負の訓練信号に寄与する。そこには、好ましい応答に役立つ振る舞いを表している可能性のあるトークンも含まれる。 本研究は、選ばれなかった各トークンについて、それを罰することが好ましい更新方向を妨げるかを推定する、DPO向けの勾配整合型トークン重み付け手法GAW-POを導入する。勾配が好ましい振る舞いと強く整合するトークンには、負の寄与を弱める一方、相反するトークンには強い罰を維持する。 本手法は、評価した選好最適化手法の中で最も高い平均性能を達成する。数学、推論、コーディング、質問応答にまたがる11のベンチマークで、標準DPOを0.97ポイント、最も強い競合ベースラインを0.65ポイント上回る。さらに、勾配に沿った重み付けが、強い選好最適化に対して大幅に頑健であることを示す。DPOの正則化パラメータβを小さくすると、標準DPOの性能は急激に低下する一方、GAW-POは改善を続ける。これらの結果は、選ばれなかったトークンの更新と好ましい振る舞いとの相互作用を考慮することが、選好最適化における有効なトークン単位の貢献度割り当てになることを示唆する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Most preference optimization methods, such as Direct Preference Optimization (DPO), apply preference supervision at the response level, although autoregressive language models are optimized token by token. As a result, all tokens in a rejected response contribute to the negative training signal, including tokens that may encode behavior that is useful for the preferred response. We introduce GAW-PO, a gradient-aligned token reweighting method for DPO that estimates, for each rejected token, whether penalizing it would interfere with the preferred update directions. Tokens whose gradients are strongly aligned with the preferred behavior receive a weaker negative contribution, while conflicting tokens retain a stronger penalty. Our method achieves the highest average performance among the evaluated preference-optimization methods, improving by 0.97 points over standard DPO and 0.65 points over the strongest competing baseline across 11 benchmarks spanning mathematics, reasoning, coding, and question answering. We further show that gradient-aligned weighting is substantially more robust to aggressive preference optimization: as the DPO regularization parameter $\beta$ decreases, standard DPO degrades sharply, whereas GAW-PO continues to improve. These results suggest that accounting for the interaction between rejected-token updates and preferred behavior provides an effective form of token-level credit assignment for preference optimization.
arXiv ID: 2610.01511 / 要約の誤りについて