arXiv論文メモ
新着一覧
cs.AI / cs.LG · 査読状況未確認

低コストな探索でコードエージェントを自己改善

Self Improvement via Fast Tree-search

Xinghong Fu, Aravinth Kulanthaivelu, Yutaro Yamada

この論文をやさしく読む

ひとことで言うと

コーディングエージェントが自分の実装を改善する候補を探すとき、すべてを実課題で試す費用を減らす方法です。LLMによる候補同士の比較を、重い評価の前の選別に使います。

何に役立つ?

限られた計算予算でエージェントの改善案を探索するために役立ちます。実課題の実行が遅い場合でも、候補比較から途中の手がかりを得て探索を進める構成です。

この研究の面白いところ

パッチの勝敗を正則化したBradley–Terryモデルで強さの得点に変え、木探索の親候補選択に使います。高価なベンチマーク評価は有望な節点に絞り、処理を分離して探索を止めにくくします。

どこまで分かった?

Polyglot全体で既存の木探索型自己改善法を上回り、CPU時間・経過時間・API費用を減らしたと報告します。要旨に具体的な改善率はなく、LLMの比較だけで最終性能を保証する方式ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

コーディングエージェントは、自分自身の実装を再帰的に変更することで、自己改善のループを形成できる。先行研究では、これによってコーディングベンチマークの性能を高められることが示されているが、既存手法は費用と計算量が大きい。 本研究では、厳しい予算制約の下でもコーディング性能を大幅に向上させる、単純でサンプル効率のよい自己改善フレームワークを導入する。候補となる自己変更の評価が主な実行時間のボトルネックであることを特定する。従来手法では、変更後のエージェントでベンチマーク課題の一部を再実行して有効性を推定するため、時間がかかる。 そこで、Recursive Self Improvement via Fast Tree-search(SIFT)を提案する。SIFTは、下流課題の評価に加え、候補パッチ同士を一対一で比較するLLM-as-a-judgeの信号を用いる。勝敗記録を正則化Bradley–Terryモデルで集約し、得られた強さのスコアを、軽量で分離された木探索における順位ベースの親サンプリングへ利用する。高コストな下流課題評価は、最も有望なノードだけに限る。 完全に分離された木探索パイプラインでは、判定者のスコアが、有望な候補パッチの探索を導く中間信号となり、遅い評価実行がボトルネックになることを防ぐ。SIFTは、CPU時間、経過時間、API費用のいずれにおいても必要資源を大幅に削減しながら、Polyglotベンチマーク全体で既存の木探索型自己進化フレームワークを上回った。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Coding agents can recursively modify their own implementations, forming a loop of self-improvement. While prior work shows this can boost performance on coding benchmarks, existing approaches are costly and compute-intensive. We introduce a simple, sample-efficient self-improvement framework that significantly improves coding performance under strict budget constraints. We identify evaluation of candidate self-modifications as the main runtime bottleneck since prior approaches estimate their effectiveness by re-running a subset of benchmark tasks with the modified agent, which is time-consuming. We introduce Recursive Self Improvement via Fast Tree-search (SIFT), which augments these downstream task evaluations with an LLM-as-a-judge signal that performs pairwise comparisons between candidate patches, where the win-loss record is aggregated with a regularized Bradley-Terry model, and the resulting strength scores drive rank-based parent sampling inside a lightweight disaggregated tree search. Expensive downstream task evaluations are reserved only for the most promising nodes. Using a fully disaggregated tree search pipeline, the judge scores provide intermediate signal to guide exploration on promising candidate patches without being bottlenecked by slow evaluation runs. SIFT outperforms existing tree-search based self-evolution frameworks on the full Polyglot benchmark with significantly lower resource requirements in terms of CPU hours, wall clock time, and API cost.

arXiv ID: 2609.19526 / 要約の誤りについて