arXiv論文メモ
新着一覧
cs.AI / cs.LG / cs.SE · 査読状況未確認

原文を言い換えずに圧縮し長時間のコード作業を続ける

CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents

Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers

この論文をやさしく読む

ひとことで言うと

長いコード作業の履歴を短くする際に、AIで言い換えて要約するのでなく、元の文章を切り詰めたり削ったりする方法です。前回の圧縮結果を再圧縮せず、毎回原文に戻ります。

何に役立つ?

考えられる用途は、長時間動くコード作成エージェントの費用を抑え、同じ予算で試行を増やすことです。要旨ではTerminal-BenchとKernelBenchで費用と性能を評価しています。

この研究の面白いところ

圧縮を重ねるたびに意味が変わる問題を、原文だけを対象にする設計で避けようとします。節約した費用を追加の試行に回す効果まで測る点が特徴です。

どこまで分かった?

費用削減の最大50%は報告された条件での最大値です。2.23倍と3.58倍は生成したCUDAカーネルの高速化であり、圧縮処理自体の速度比ではありません。モデル間の順位も今回のベンチマークと設定における報告です。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

エージェントは数百万トークンの文脈を必要とする複雑な問題に取り組むことが多く、文脈窓が限られるため、セッションをまたいで圧縮する必要がある。本研究では自動圧縮技術CliffCompactionを開発する。限られた文脈の下で費用を最大50%削減しながらTerminal-Benchの性能を維持または改善し、テスト時の計算量拡大の効率を新たな水準へ高め、KernelBenchで最先端の結果を達成する。 CliffCompactionによる試行1回当たりの費用削減は、テスト時に計算量を増やす際の性能と費用のトレードオフを改善する。全コンテキストを使う2回の実行より低い費用で、Terminal-Benchの性能を10パーセントポイント超改善する。並列のテスト時計算量拡大では、Kimi K2.6がOpus 4.7に並び、Opus 4.6とGPT-5.3 Codexをより低い費用で上回れるようになる。 有効性の鍵は、内容の切り詰めや削除だけを行い、言い換えも書き換えもしないことで、圧縮情報を原文に忠実に保つことにある。圧縮済みのものを再圧縮することは決してない。各回は元の内容だけを対象とし、以前の圧縮出力を破棄するため、文脈のずれが蓄積しない。これらの性質によって、100万トークンを超えるセッションを通じた継続的な学習が持続する。KernelBenchでは、CliffCompactionは200ステップ後に2.23倍、400ステップ後に3.58倍のCUDAカーネル高速化に達し、汎用的な圧縮技術であるにもかかわらず、専用の探索アルゴリズムや学習済みエージェントを上回る。Claude Code、Codexなどの実行基盤で使える、基盤に依存しないAPIプロキシ実装をオープンソースで公開する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Agents often work on complex problems that require millions of tokens of context, which necessitates compacting across sessions due to limited context windows. We develop CliffCompaction, an autocompaction technique that reduces cost by up to 50% under a bounded context while maintaining or improving performance on Terminal-Bench and achieving new levels of efficiency for test-time scaling and state-of-the-art results on KernelBench. The per-rollout savings of CliffCompaction make the performance--cost trade-off of test-time scaling more efficient, adding over 10 percentage points on Terminal-Bench for less than the cost of two full-context runs. Under parallel test-time scaling, CliffCompaction lets Kimi K2.6 match Opus 4.7, and exceed Opus 4.6 and GPT-5.3 Codex at lower cost. The key to CliffCompaction's effectiveness is that it keeps compacted information faithful by only truncating or dropping content, never rephrasing or rewriting it. We never compact a compaction---each pass operates only on original content, and prior compacted output is discarded, preventing context drift from accumulating. These properties sustain continual learning over sessions exceeding a million tokens: on KernelBench, CliffCompaction reaches CUDA kernel speedups of $2.23\times$ after 200 steps and $3.58\times$ after 400 steps, surpassing specialized search algorithms and trained agents despite being a general-purpose compaction technique. We open-source a scaffold-agnostic API-proxy implementation of CliffCompaction usable with Claude Code, Codex and other harnesses.

arXiv ID: 2609.26779 / 要約の誤りについて