arXiv論文メモ
新着一覧
cs.LG / cs.AI · 査読状況未確認

PPOの価値予測が平坦になる問題を疎な教師信号で緩和

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

Yizhuo Li, Jianhao Yan, Yun Luo, Zhi Wang, Futing Wang, Rong-Xi Tan, Kanghui Tian, Ganqu Cui, Ning Ding, Peilin Zhao, Yafu Li, Yu Cheng

この論文をやさしく読む

ひとことで言うと

文章生成中の各状態の価値を予測するモデルが、本来ある価値の変化をならしてしまう問題を調べ、離れた少数の状態だけで学習させて改善する方法です。

何に役立つ?

PPOで言語モデルを強化学習するとき、クリティックの学習信号の与え方を見直す手段になります。

この研究の面白いところ

教師信号をすべての状態に与えるより、1応答あたり3状態に絞る方が、相関した冗長な更新や暗黙の分散罰則を抑えられると報告しています。

どこまで分かった?

言語モデルでの実験はQwen3-Baseの複数規模・評価セットに関するものです。すべての強化学習設定で3状態が最適だという保証ではなく、要旨に個別の改善幅はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデルの強化学習では、近接方策最適化(PPO)は通常、状態価値を推定し、方策更新の分散を減らすためにクリティックを用いる。しかし本研究では、PPOのクリティックに体系的な失敗パターンを見いだし、Value Flatteningと名付ける。複数のモンテカルロ継続から推定した状態価値は途中の状態間で急に変化するのに、クリティックの予測は比較的平坦なままになる現象である。この現象は条件を制御したFrozenLake環境でも観測され、状態空間が大きくなるほど顕著になる。 理論と実証の分析により、Value Flatteningを、クリティック損失に暗黙に含まれる分散への罰則、および似た勾配を持つ時間的に相関した状態からの冗長な更新に結び付ける。これを受け、各応答の中で互いに十分離れた少数の状態だけに価値損失を適用し、両方の影響を緩和するSParse Proximal Policy Optimization(SP³O)を導入する。 Qwen3-Baseでの実験では、応答あたりわずか3状態に教師信号を与えるSP³Oが、Value Flatteningを緩和し、モデル規模や評価セットをまたいで学習後の方策を一貫して改善する。これらの結果は、標準PPOでのクリティック学習において、Value Flatteningが重要でありながら見過ごされてきた失敗パターンであることを特定し、単純な疎な教師信号戦略で緩和できることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

In reinforcement learning for large language models, Proximal Policy Optimization (PPO) commonly uses a critic to estimate state values and reduce the variance of policy updates. However, we uncover a systematic failure mode in PPO critics, which we call Value Flattening: state values, estimated from multiple Monte Carlo continuations, change sharply across intermediate states while critic predictions remain comparatively flat. We further observe this phenomenon in a controlled FrozenLake environment and find that it becomes more pronounced as the state space grows. Our theoretical and empirical analyses relate Value Flattening to an implicit variance penalty in the critic loss and redundant updates from temporally correlated states with similar gradients. Motivated by these findings, we introduce SParse Proximal Policy Optimization (SP$^3$O), which applies the value loss to only a few well-separated states in each response to mitigate both effects. Experiments on Qwen3-Base show that SP$^3$O with only three states supervised per response can mitigate Value Flattening and consistently improve the learned policy across model sizes and evaluation suites. Together, our results identify Value Flattening as an important yet overlooked failure mode of critic learning in standard PPO and show that a simple sparse supervision strategy can mitigate it.

arXiv ID: 2609.18708 / 要約の誤りについて