arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

自己更新するAIの能力を途中経過まで評価する

Beyond Endpoint Performance: Process-Level Evaluation of Self-Evolving Agents

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

この論文をやさしく読む

ひとことで言うと

記憶やスキルを更新するAIが、最終的に高得点だったかだけでなく、いつ能力を獲得し、いつ失うかを追跡する評価方法です。

何に役立つ?

自己更新のどの段階に問題があるかを切り分けられます。良い候補を作れないのか、作れても選べないのかを区別することで、改善箇所を見つけるのに役立ちます。

この研究の面白いところ

性能を改善する候補が存在しても、実際に採用される更新がその水準に達しないという差に注目しています。更新の生成だけでなく選別が重要だと示します。

どこまで分かった?

基盤モデルとツールを固定し、記憶などの成果物を更新する設定です。評価した手法で規則適応が安定しなかったという結果を、あらゆる自己更新システムへそのまま一般化はできません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自己進化するエージェントは、対話からのフィードバックを記憶やスキルなどの持続的な成果物へ変換し、それが後の判断を導く。経験の流れに沿ってこれらの成果物が繰り返し更新されるにつれ、それが支える能力も変化しうる。したがって、最終時点の性能だけでは自己進化を十分に把握できない。目標とする能力がいつ現れ、後の更新がそれを強めるのか、保つのか、弱めるのかを特定するには、過程の評価が不可欠である。 この考えに基づき、成果物の更新による自己進化の途中で個々の能力を追跡するベンチマーク、EvoPathBenchを提案する。EvoPathBenchは基盤モデルとツールを固定し、変化する成果物を連続するチェックポイントで凍結して、評価用に取り置いたエピソードで目標能力を測る。公開取引データと較正された軌跡を用いてエージェントの自己進化を評価し、未見タスクへの汎化、無関係な学習後の能力保持、新しい証拠への規則の適応という三つの能力を検査する。 実験結果では、似た未見タスクで得られた改善は分布が変わると弱まることが多く、保持能力の低下は少数の進化経路に集中し、どの手法も信頼できる規則適応を達成しないことが分かった。さらに、自己進化によって評価用データで大きな改善をもたらす候補成果物を生成できても、選択された更新は一貫してその可能性を実現しきれない。これらの知見は、能力ごとに過程を評価することを自己進化解析の基盤として位置づけ、候補の評価と選択を重要な改善対象として特定する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Self-evolving agents convert interaction feedback into persistent artifacts, such as memories or skills, which in turn guide subsequent decisions. As these artifacts are iteratively updated throughout an experience stream, the capabilities they support may evolve. Consequently, endpoint performance alone offers an incomplete view of self-evolution. Process-level evaluation is therefore essential to identify when a target capability emerges and whether later updates strengthen, preserve, or weaken it. Motivated by this, we propose \textsc{EvoPathBench}, a benchmark that tracks individual capabilities during artifact-level self-evolution. EvoPathBench fixes the base model, tools, freezes evolving artifacts at successive checkpoints, and evaluates the target capability on held-out episodes. This benchmark evaluates agent self-evolution using public trading data and calibrated trajectories. It tests three capabilities: generalization to unseen tasks, retention after unrelated learning, and rule adaptation to new evidence. Experimental results show that gains on similar unseen tasks often weaken under distribution shift, retention losses are concentrated in a minority of evolution paths, and no method achieves reliable rule adaptation. Moreover, while self-evolution enables agents to generate candidate artifacts with substantial held-out gains, the selected updates consistently fall short of realizing this potential. Together, these findings establish capability-level process evaluation as a foundation for analyzing self-evolution, identifying candidate evaluation and selection as key targets for improvement.

arXiv ID: 2609.24663 / 要約の誤りについて