arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

AIエージェントが失敗した地点から技能を修正する方法

A Wrong Turn Does Not Ruin the Journey: Deviation-Guided Skill Self-Evolution for LLM Agents

Yichun Feng, Jiawei Wang, Haozhe Sun

この論文をやさしく読む

ひとことで言うと

AIエージェントの作業で、うまく進んだ部分を残し、間違い始めた箇所だけ技能を直す方法です。

何に役立つ?

ツールを使うエージェントの失敗記録から、既に有効な手順を壊さず改善するための参考になります。

この研究の面白いところ

失敗の直前まで同じ履歴を教師にも与え、後半の行動だけを比較して局所的な更新を作ります。

どこまで分かった?

結果は要旨に挙げられた三つのベンチマークでの比較です。実運用での改善幅や長期的な効果の数値は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデルのエージェントは、複雑なツール利用の課題を解くために自然言語で記した技能にますます頼っている。しかし、こうした課題には複数の正しい解法があることが多く、失敗した行動の流れを一つの成功例に無理に合わせて技能を改善するのは適切でない。また、失敗した流れも最初からすべて誤りとは限らず、有用な証拠を集めて進展した後で、後半だけ誤った方向へ進むことがある。そこで、失敗全体を大ざっぱに振り返るのではなく、有効な問題解決がどこから崩れ始めたかを特定すべきだと主張する。この考えから、逸脱地点に基づく技能の自己改善の枠組みSkillPivotを提案する。実行の妥当性、目標への進展、行動の多様性を用い、有用な前半から誤った後半へ移る地点を検出する。次に、より強い教師モデルが同じ前半と同じ対話履歴から続け、成功する別の進め方を作る。学習対象の失敗した後半と教師の成功した後半を対比し、すでに有効な指針は残しながら、その箇所に限った技能更新を生成する。ToolQA、LogicBench、WildClawBenchでの実験では、SkillPivotは比較した技能改善手法を一貫して上回り、複数のエージェントモデルを改善し、簡潔で他へ移せる技能更新を生み出した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language model agents increasingly rely on natural-language skills to solve complex tool-use tasks. However, such tasks often admit multiple valid solution paths, making it inappropriate to improve skills by forcing failed trajectories to match a fixed successful trajectory. Moreover, failed trajectories are rarely entirely wrong: an agent may first collect useful evidence and make meaningful progress, but later deviate into an erroneous suffix. We therefore argue that skill self-evolution should identify where productive problem solving begins to break down, rather than reflect coarsely over the entire failure. Based on this insight, we propose SkillPivot, a deviation-point-guided framework for skill self-evolution. SkillPivot detects the transition from a useful prefix to an erroneous suffix using execution validity, goal progress, and action diversity. A stronger teacher then continues from the same prefix and produces a successful alternative under the same interaction history. By contrasting the student's failed suffix with the teacher's successful suffix, SkillPivot generates localized skill updates while preserving already effective guidance. Experiments on ToolQA, LogicBench, and WildClawBench show that SkillPivot consistently outperforms competing skill-evolution methods, improves multiple agent models, and produces compact, transferable skill updates.

arXiv ID: 2609.29154 / 要約の誤りについて