自動研究ループでエージェント実行基盤のトークン消費を削減
SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
この論文をやさしく読む
ひとことで言うと
コーディングエージェントの実行・文脈圧縮・観測処理などを改善し、長い作業で消費するトークンを減らす仕組みです。
何に役立つ?
継続的にツールを使うエージェントの運用コストを評価・削減するための研究です。モデル本体ではなく、周辺の実行制御を改良します。
この研究の面白いところ
多様な環境で自動研究ループを回して残った四つの機構を組み合わせます。51課題で比較対象Piと同程度の性能を保ち、記録されたトークン通信量を44.7〜49.0%減らしたと報告します。
どこまで分かった?
費用削減や時間当たりの節約額は評価モデル・環境での推計です。あらゆるタスクや料金設定で同じ削減が得られるという保証ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
コーディングエージェントが、人の監督下でのコード補完から無人で昼夜を通した探索へ移行するにつれ、その作業は個別の予測から、推論、ツール利用、フィードバックを繰り返す長い過程へと広がる。そのため、再帰的な自己改善を大規模化するには、トークン効率が重要になる。 本研究では、実行基盤であるハーネスの層に、再帰的自己改善(RSI)に着想を得た手法を適用する。ハーネスの実行を評価する環境の数と多様性を増やしながら、自動研究ループを拡張する。この規模では、開発時の環境以外にも移転できる再利用可能な改善が得られ、ハーネスの自動探索を本番運用水準の成果に近づけられる。選択を経て残った4つの仕組みがSoL-Piを構成し、行動の実行、コンテキスト圧縮、観測の取り扱い、委任した読み取りをカバーする。 51課題からなるEdgeBench評価では、SoL-PiはGPT-5.6 SolとOpus 5のいずれでもPiと同程度の性能を達成しながら、記録されたトークン通信量を44.7〜49.0%、API費用を約3分の1削減した。時間当たりの推定節約額に換算すると、CodexおよびClaude Codeの標準ハーネスに対して8.75〜13.50ドル、Piに対して4.36〜5.71ドルとなる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
As coding agents move from supervised code completion to unattended, around-the-clock exploration, their work expands from isolated predictions into long trajectories of reasoning, tool use, and feedback. Token efficiency therefore becomes important for scaling recursive self-improvement. We take an RSI-inspired approach at the harness layer, scaling auto-research loops across increasingly numerous and diverse environments for harness rollouts. At this scale, the process yields reusable improvements that transfer beyond their development setting, moving automated harness discovery toward production-level outcomes. Four mechanisms survive selection and form SoL-Pi, spanning action execution, context compaction, observation handling, and delegated reading. On the 51-task EdgeBench evaluation, SoL-Pi achieves performance comparable to Pi across GPT-5.6 Sol and Opus 5 while reducing recorded token traffic by 44.7-49.0% and API cost by about one third. In other words, estimated hourly savings are \$8.75-\$13.50 relative to native Codex and Claude Code harnesses, and \$4.36-\$5.71 relative to Pi.
著者のコメント
15 pages, 8 figures, 4 tables. Code: https://github.com/NVlabs/SoL-Pi . Project page: https://nvlabs.github.io/SoL-Pi/
arXiv ID: 2609.20519 / 要約の誤りについて