検証可能報酬による学習で推論の言葉が変わる条件
On Language Drift during RLVR Post-Training
この論文をやさしく読む
ひとことで言うと
正解を報酬にして推論モデルを学習させると、途中の文章が人に読みづらい独特の表現へ変化する理由を調べた研究です。理論的な条件と、新しい推論課題での実証結果を示しています。
何に役立つ?
推論性能だけでなく、推論過程を人が確認できるかも重視する学習設計の検討に役立ちます。読みやすさへの制約が報酬や性能に影響し得ることを考える材料になります。
この研究の面白いところ
基盤モデルに既にある能力を引き出す課題と、そこから引き出せない新しい課題を区別しています。単に文章が乱れる現象の報告にとどまらず、最適化圧力と報酬制約の関係を論じます。
どこまで分かった?
要旨には定理の形式的な仮定や、実証に用いたモデル・課題・効果量の詳細がありません。監視可能性と性能の両立についての示唆を、全ての学習法やモデルに共通する無条件の結論と解釈することはできません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
検証可能な報酬を用いた強化学習(RLVR)による事後学習の枠組みを主な原動力として、LLM推論モデルは近年進歩し、非常に複雑な課題を達成できるようになった。しかし、その能力の向上と並行して、LLMの思考連鎖(CoT)には、珍しく非標準的で、一見意味をなさない言葉遣いという、言語ドリフトの兆候がますます現れている。この現象はよく記録されており、CoTの監視可能性を損なう可能性もあるが、その原因はこれまで十分には理解されていない。 本論文では、言語ドリフトが生じる条件を特定する。まず、RLVRの最適化圧力が無制限の言語ドリフトを許す一方、教師あり微調整はそうではないことを理論的に証明する。次に、言語ドリフトは、目標の振る舞いを基盤モデルから引き出せないような新しい推論課題に対するRLVRで、特に生じることを実証的に示す。最後に、期待報酬を制約せずに言語ドリフトを制約することは不可能だと証明する。これは、能力の最前線におけるRLVR事後学習では、性能を損なわずにCoTの監視可能性を改善することはできない可能性を示唆する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Recent advances in LLM reasoning models---driven primarily by the paradigm of post-training via reinforcement learning with verifiable reward (RLVR)---have enabled them to accomplish impressively complex tasks. However, in parallel with their rising capabilities, LLMs have increasingly displayed signs of language drift in their chains of thought (CoTs): unusual, non-standard, and seemingly nonsensical language use. Although it is well-documented---and can potentially impair CoT monitorability---the causes of language drift are thus far poorly understood. In this paper, we identify the conditions under which language drift occurs: we prove theoretically that RLVR optimization pressure permits unbounded language drift, while supervised fine-tuning does not. We then show empirically that language drift specifically arises during RLVR on novel reasoning tasks---i.e. when the target behavior cannot be drawn out of the base model. Finally, we prove that it is not possible to constrain language drift without constraining expected reward, suggesting that CoT monitorability cannot be improved without harming performance during RLVR post-training at the frontier.
著者のコメント
22 pages; 15 figures; 4 tables
arXiv ID: 2610.02015 / 要約の誤りについて