長期タスクを行うAIエージェントが過去の推論を忘れてよい条件
When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression
この論文をやさしく読む
ひとことで言うと
長く作業するAIエージェントの推論履歴を、行動や観測は残しながら選んで削り、負担と成績への影響を調べた研究です。
何に役立つ?
長期タスクを行うエージェントで、文脈の長さやトークン使用量を抑える方法の検討に役立ちます。260課題の評価では平均報酬の改善と3種類のトークン使用量の削減が報告されています。
この研究の面白いところ
局所的な削除が後の行動を変え、全体の計算量に非線形な影響を及ぼします。また、必要な状態をファイルやツール出力に残した後は、過去の推論を置き換えやすいという分析です。
どこまで分かった?
数値結果はWorkBuddyBenchの260課題でのものです。外部化後の置き換えやすさは、要旨では複数の分析が示唆する結果として述べられています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
長い期間にわたって動く言語モデルのエージェントは、過去の推論履歴を蓄積し続ける。このため、以前の判断が実行され、その結果も観測された後でさえ、文脈の長さと推論の費用が増える。静的な思考過程の圧縮と異なり、過去の推論を削除すると、将来の行動や、その後の対話の進み方が変わる可能性がある。本研究は、どのようなときに推論を安全に忘れられるかを調べる。 Interaction Aware Compression for Long Horizon Reasoning(ICLR)という、追加学習なしで動くオンライン手法を提案する。固定した代理モデルのエントロピーを使って推論ブロックに順位を付け、行動、ツール呼び出し、観測結果は保持する。WorkBuddyBenchの260課題では、平均報酬が0.699から0.718に改善し、入力トークン、出力トークン、キャッシュ読み取りトークンはそれぞれ25.5%、14.4%、33.3%減った。要素を取り除く比較実験では、局所的な推論の削除が後続の対話を変え、全体の計算量を非線形に変化させる「軌跡増幅」が見られた。表現の探査、活性化の差し替え、制御した対話軌跡の解析からは、タスクに関係する導出済みの状態がコード、ファイル、ツール出力、環境からのフィードバックへ確実に外部化された後は、過去の推論をより置き換えやすいことが示唆される。これらの結果は、エージェントの推論を、永久に保持すべき対話履歴ではなく、動的な作業状態として捉えるものである。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Long horizon language model agents continually accumulate reasoning history, increasing context length and inference cost even after earlier decisions have been executed and observed. Unlike static Chain of Thought compression, removing historical reasoning can change future actions and the resulting interaction trajectory. We study when such reasoning can be safely forgotten. We propose Interaction Aware Compression for Long Horizon Reasoning (ICLR), a training free online method that ranks reasoning blocks using frozen proxy entropy while preserving actions, tool calls, and observations. On 260 WorkBuddyBench tasks, ICLR improves average reward from 0.699 to 0.718, while reducing input, output, and cache read tokens by 25.5%, 14.4%, and 33.3%, respectively. Ablations reveal trajectory amplification, where local reasoning deletion produces nonlinear changes in total computation by altering subsequent interaction. Representation probing, activation patching, and controlled trajectory analyses further suggest that historical reasoning becomes more replaceable once task relevant derived state has been reliably externalized into code, files, tool outputs, or environmental feedback. These results characterize agent reasoning as dynamic working state rather than permanent interaction history.
著者のコメント
30 pages
arXiv ID: 2609.29875 / 要約の誤りについて