追加学習が失わせるエージェントの解答範囲を測る
Sharpening Tax in Post-Training
この論文をやさしく読む
ひとことで言うと
追加学習で1回の回答は当たりやすくなっても、何度試しても解けない問題が増えることがあります。その代償をエージェント課題で測り、抑える方法を調べています。
何に役立つ?
1回で正解する性能と、計算時間を増やして解ける問題を広げる性能を分けて評価するのに役立ちます。多数回の試行を許す運用では、モデル選択の見方が変わりえます。
この研究の面白いところ
事前学習だけのモデルでも、軽量な実行枠組みと十分な試行回数があれば、追加学習後より広い問題を解ける点を示しています。難しさに応じた温度調整で、両方の性能の改善も試みています。
どこまで分かった?
比較は4系列14組と3ベンチマークの42条件、提案サンプラーの学習評価は2環境です。すべての事後学習や課題で同じ代償が生じるという結果ではなく、要旨に個別の改善量はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)の強化学習(RL)による事後学習について、基盤モデルにすでにある振る舞いを先鋭化するだけであり、解ける問題の範囲を犠牲にして1回の試行の正解率を高める、という仮説が現れている。このトレードオフは数学やコーディングの課題で観察されてきたが、複数ターンのツール利用や対話に、事後学習で新たに獲得する能力が必要となりうるエージェント型の課題にも当てはまるとは限らない。驚くべきことに、軽量な推論用の実行枠組みを備えた事前学習済みLLMも、有能なエージェントとして機能することが分かった。1回の試行の正解率(pass@1)ははるかに低いにもかかわらず、テスト時に十分な計算予算を与えると、解ける問題の範囲(pass@K)では事後学習後の対応モデルを上回ることが多い。 さらに、その仕組みを分析し、事後学習が課題を「常に解ける」か「決して解けない」かの両極へ押しやることで、解ける範囲を犠牲にしてサンプリング効率と一貫性を改善することを示す。この代償を測るため、事後学習によってテスト時の計算量拡大の効果がどれほど失われるかを定量化する診断指標Sharpening Taxを提案する。4系列の14組の基盤モデルと事後学習済みモデルを、3つのエージェント型ベンチマークで調べた計42条件では、この代償は大半の設定で見られ、少数の試行軌跡から推定でき、他の指標ともよく相関する。 最後に、推定したプロンプトの難しさに応じてサンプリング温度を調整する、簡単に組み込めるベイズ的サンプラー、事後分布で温度調整するグループサンプリング(PTGS)を提示する。2つのエージェント環境でRL学習中に適用すると、固定温度のベースラインよりSharpening Taxが小さくなり、繰り返しサンプリングした際により多くの課題を解けるとともに、1回の試行の正解率も改善した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
An emerging hypothesis about reinforcement learning (RL) post-training of large language models (LLMs) is that it merely sharpens existing behaviors of a base model, improving single-shot accuracy at the cost of solution coverage. Although this trade-off has been observed in math and coding tasks, it need not extend to agentic tasks, where multi-turn tool use and interaction may require capabilities newly acquired during post-training. Our surprising finding is that pre-trained LLMs, equipped with a light inference harness, can serve as capable agents. Despite far lower accuracy (pass@1), they often surpass their post-trained counterparts in solution coverage (pass@K) given a sufficient test-time budget. We further analyze the underlying mechanism and show that post-training pushes tasks toward two extremes, always solved or never solved, and thereby improves sampling efficiency and consistency at the cost of solution coverage. To measure this cost, we propose Sharpening Tax, a diagnostic metric that quantifies the loss in test-time scalability after post-training. Across 14 base/post-trained model pairs from four families and three agentic benchmarks (42 cases in total), the tax is prevalent in most settings, can be estimated from a few rollouts, and correlates well with other metrics. Finally, we present posterior-tempered group sampling (PTGS), a simple plug-and-play Bayesian sampler that adapts the sampling temperature per prompt to its estimated difficulty. Applied during RL training in two agentic environments, PTGS pays a smaller tax than the fixed-temperature baseline, solving more tasks under repeated sampling while also improving single-shot accuracy.
arXiv ID: 2610.01509 / 要約の誤りについて