ツール利用エージェントの操作を証拠に基づき差し替える検証法
TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents
この論文をやさしく読む
ひとことで言うと
エージェントがツールを使う直前に、履歴上の証拠がある場合だけ代替操作と比較して差し替える方法。
何に役立つ?
考えられる用途は、ツール利用エージェントの失敗を減らすための実行前検証である。要旨ではBFCL V4の159課題で成功率の改善を報告している。
この研究の面白いところ
疑わしい操作を無条件に直さず、証拠条件、構造検査、候補の順序を入れ替えた二重の比較を通した場合だけ介入する。
どこまで分かった?
成功率の結果は完全な再現ペアがある159課題での主解析である。成功から失敗への逆行が観測されなかったのはこの評価範囲であり、一般に起きないとの証明ではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
局所的には妥当に見える一回のツール呼び出しが、それまで成功していたエージェントの処理全体を失敗に導くことがある。一方、疑わしいというだけで介入しても、差し替えた操作が、検証によって防ぎたかった失敗を引き起こしかねない。本研究はTwinCheckという推論時の検証方針を提案する。操作履歴の中で立てた失敗仮説に結び付く証拠条件を満たす場合だけ、差し替えを検討する。履歴に根拠を持つ反事実的な代替操作「ネガティブ・ツイン」を作り、構造上の検査を通過し、候補の提示順を入れ替えた両方の場合に対比較の検証器が代替案を選んだときに限り、元の提案を差し替える。 対をなす評価では、最初の差し替えが受け入れられるまで、エージェントの解析済み応答と操作を正確に再現して固定し、介入の効果を再サンプリングの効果から分けた。正確な再現の対がそろった159件の複数ターンのBFCL V4課題を主解析に用いたところ、完全な方針はGPT-5.6 Solの課題成功率を45.3%から58.5%へ高めた。課題単位のブートストラップによる95%信頼区間は改善幅8.2~18.8パーセントポイントで、成功から失敗への逆行は観測されなかった。これらの結果は、実行直前の修正を制約付きの比較として捉え、代替操作そのものを検証対象にすることを示している。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
A single locally plausible tool call can derail an otherwise successful agent trajectory. Suspicion alone does not justify intervention, because the replacement itself can introduce the very failure verification is meant to prevent. We introduce TwinCheck, an inference-time verification policy that considers replacement only when the trace satisfies an evidence condition tied to a trace-local failure hypothesis. It constructs a trace-grounded counterfactual alternative, a negative twin, and replaces the agent's proposal only if the twin passes structural checks and the pairwise verifier prefers it in both candidate orders. For paired evaluation, exact replay holds the agent's parsed responses and actions fixed until the first accepted replacement, separating intervention effects from resampling. In the primary analysis of 159 multi-turn BFCL V4 tasks with complete exact-replay pairs, the complete policy raises task success for GPT-5.6 Sol from 45.3% to 58.5% (95% task-bootstrap CI [8.2, 18.8]), with no observed success-to-failure regressions. Together, these findings recast execution-boundary repair as a constrained comparison, making the counterfactual action itself the object of verification.
arXiv ID: 2609.26911 / 要約の誤りについて