arXiv論文メモ
新着一覧
cs.LG / cs.AI / cs.CL · 査読状況未確認

環境の観測も学習するとエージェントの探索が変わる

Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah

この論文をやさしく読む

ひとことで言うと

エージェントに行動だけでなく、その後の環境観測も予測させる事前調整が、後続の強化学習に役立つかを調べます。

何に役立つ?

既存の行動軌跡を追加データなしで活用し、行動の結果を見通す学習に使う方法です。

この研究の面白いところ

SFT直後は似ていてもGRPO後に差が生じ、4Bモデルでは未知領域のコード編集でもpass@1が4.2ポイント改善しました。

どこまで分かった?

8Bでは複数試行の成功率を上げる一方、1回の試行の信頼性を一部失っています。すべての規模で全指標が改善する結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

エージェントの軌跡には、エージェントが行うことと、その次に起きることが記録される。しかし標準的な教師あり微調整(SFT)は、エージェントが書いた行動トークンだけに損失を適用し、環境の観測は文脈として使うだけで予測対象にはしない。この慣習が、その後の強化学習にとって最善の初期化になるのかを問う。 各軌跡に既に含まれる観測トークンも教師信号にするActObsを導入する。運用中のエージェントが観測を生成することはないが、その予測を学ぶと、データ、パラメーター、系列トークン、順伝播を追加せずに、方策が行動の結果をモデル化するよう促せる。SFT後の両手法の性能は似ているが、GRPO後には差が生じる。Qwen3-4Bでは、ActObsから始めたGRPOはTerminal-Bench 2.0のすべての評価サンプリング予算で、行動だけを学習した比較対象より高いpass@kを達成する。Qwen3-8Bでは、pass@1の信頼性をいくらか犠牲にしつつ、pass@kを高め(pass@16で3.4パーセントポイント増)、より多くの異なる課題を解く。 この優位性は、SFTと強化学習で未見の課題を用いるaider-polyglotの異分野コード編集にも及ぶ(40億級のpass@1で4.2パーセントポイント増)。ActObsは強化学習中により多くのエントロピーを保ち、必要な方策の変化は小さく、最終方策がSFT初期状態により近く留まる。 分析では、この差をSFTにさかのぼって説明する。行動と観測の勾配は急速に直交する一方、行動だけの学習は大きな観測の残差勾配を残し、環境予測を基盤モデル以下に劣化させる。同時教師あり学習は、この一面的な特化を防ぎ、結果の予測能力を保って、その後の探索に方策を備えさせる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Agent trajectories record what an agent does and what happens next. Yet standard supervised fine-tuning (SFT) applies loss only to agent-authored action tokens, using environment observations as context but not as prediction targets. We ask whether this convention provides the best initialization for subsequent reinforcement learning. We introduce ActObs, which also supervises the observation tokens already present in each trajectory. Although deployed agents never generate observations, learning to predict them encourages the policy to model action consequences without adding data, parameters, sequence tokens, or forward passes. The methods perform similarly after SFT but diverge after GRPO. On Qwen3-4B, GRPO from ActObs achieves higher pass@k at every evaluated sampling budget than its action-only counterpart on Terminal-Bench 2.0. On Qwen3-8B, it trades some pass@1 reliability for higher pass@k (+3.4 pp at pass@16) and solves more distinct tasks. The advantage extends to cross-domain code editing on aider-polyglot (+4.2 pp at pass@1 at 4B), whose tasks are unseen during SFT and RL. ActObs retains more entropy during RL while requiring less policy movement, leaving the final policy closer to its SFT initialization. Our analysis traces this difference to SFT: action and observation gradients rapidly become orthogonal, while action-only training leaves a large residual observation gradient and degrades environment prediction below the base model. Joint supervision prevents this one-sided specialization, preserving consequence prediction and preparing the policy for downstream exploration.

著者のコメント

29 pages, 9 figures, 11 tables

arXiv ID: 2609.20715 / 要約の誤りについて