arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

長いコード修正作業で文脈を圧縮する時点と内容を学習

AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents

Xuan Zhang, Longtao Zheng, Cunxiao Du, Bo An, Xin Dong

この論文をやさしく読む

ひとことで言うと

長いコード修正の途中で、いつ履歴を整理し、何を残して作業を再開するかをエージェント自身に学習させます。

何に役立つ?

リポジトリをまたいで調査・修正・テストを続けるエージェントの成功率向上に役立つ可能性があります。2つの評価セットで合格率の絶対改善が報告されています。

この研究の面白いところ

容量不足になる前でも古い探索情報を整理する価値を扱います。圧縮判断だけでなく、その後の行動まで修正した軌跡で学習させています。

どこまで分かった?

改善はSWE-bench Verifiedで9.2ポイント、SWE-PolyBench Verifiedで5.0ポイントです。評価済み予算と16K・256Kの条件での結果で、任意の課題や文脈長への保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

コーディングエージェントは、コードの確認、検索、編集、テストを長く繰り返して、リポジトリ規模のソフトウェア工学の課題を解く。課題が進むにつれ以前の探索内容は古くなるため、文脈管理は単に容量超過を避けるだけではない。いつ圧縮するか、どの作業状態を残すか、そこからどう再開するかを決めなければならない。私たちは、これらの判断を方策の一部として学習するコーディングエージェントAutoCompactを提案する。 学習データの収集では、基盤エージェントをコーディング課題で実行し、判定役が圧縮の判断、要約、圧縮後の行動を評価する。不適切な出力は環境で実行する前に修正したものへ置き換え、各軌跡が修正済みの判断から続くようにする。これらの軌跡を教師ありファインチューニングに用いた後、課題成功の報酬を使う強化学習で、コーディングと圧縮を共同で最適化する。 SWE-bench VerifiedとSWE-PolyBench Verifiedの実験では、AutoCompactは基盤モデルに対して合格率をそれぞれ絶対値で9.2ポイントと5.0ポイント改善した。評価したすべての推論予算で改善が維持され、容量超過が一度も起きない256Kの文脈窓でも、容量超過によって予備の圧縮処理が起動する16Kの窓でも成立した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Coding agents solve repository-level software engineering tasks through long trajectories of code inspection, search, editing, and testing. As a task progresses, earlier exploration becomes stale, so managing context is more than avoiding overflow: an agent must decide when to compact, what working state to preserve, and how to continue from it. We introduce AutoCompact, which trains a coding agent to make these decisions as part of its policy. To collect training data, we run the base agent on coding tasks and use a judge to review its compaction decisions, summaries, and actions after compaction. Flawed outputs are replaced with corrected ones before being executed in the environment, so each trajectory continues from the corrected decisions. We use these trajectories for supervised fine-tuning, then jointly optimize coding and compaction through reinforcement learning with task-success rewards. Experiments on SWE-bench Verified and SWE-PolyBench Verified show that AutoCompact improves pass rates over the base model by an absolute 9.2\% and 5.0\%, respectively. The improvements hold across all evaluated inference budgets, with a 256K context window that never overflows and with a 16K window whose overflow triggers fallback compaction.

arXiv ID: 2610.02163 / 要約の誤りについて