arXiv論文メモ
新着一覧
cs.AI / cs.SE · 査読状況未確認

企業向けAIの最終出力だけでは見落とす手順の逸脱

Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills

Ngoc Phuoc An Vo, Aarya Doshi, and Vadim Sheinin

この論文をやさしく読む

ひとことで言うと

企業向けAIが最後に正しい数値を出しても、途中でツールの使い方や実行順序を誤っていることが多いかを調べる評価方法です。

何に役立つ?

ツールやモデル、仕様を変更したときに、最終結果と実行過程の両方を回帰テストする用途が考えられます。複数のチェック不合格を依存関係でまとめることで、原因を調べる単位も整理できます。

この研究の面白いところ

最終数値チェックに合格した175試行のうち162試行で、別の逸脱を評価器が検出しました。最終状態のチェックを7項目へ広げても、途中手順の違反が多数残った点が特徴です。

どこまで分かった?

割合は評価した2スキルと構成群における、評価器が定めた逸脱の割合です。あらゆる企業AIで同じ率になるとは示していません。実際のAPI変更を追う長期的検証は今後の課題で、交互作用の分析も探索的とされています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

企業向けAIエージェントのスキルは、ツールAPI、モデル、仕様の変更に伴って進化するが、最終出力の評価だけでは処理過程での振る舞いの変化を見逃す可能性がある。本研究では、結果レベルと過程レベルのチェックを組み合わせる継続的評価フレームワークを提案し、企業のValue Aware ResiliencyシステムにおけるBusiness Value DeterminationスキルのRevenue版とProductivity版へ適用する。このフレームワークは、実行ごとの正解値を独立に計算し、再利用可能なテンプレートテストを具体化し、プログラムによる検査と役割を狭く限定したLLM判定器を通じて、ツール選択、引数、実行順序、データベースの整合性を評価する。 2種類のスキル、2種類の仕様、2種類のエージェント実行基盤、3モデルにわたる240試行を評価した。適用可能な最終数値チェックをすべて通過した175試行のうち、162試行(92.6%、Wilson法による95%信頼区間87.7〜95.6%)に、評価器が検出した別の逸脱があった。7つのチェックを使う、より広い最終状態の定義でも、合格した164実行のうち151実行(92.1%、95%信頼区間86.9〜95.3%)が依然として実行経路のチェックに違反していた。依存関係に基づく帰属解析によって、1実行当たり平均6.34個の不合格チェックを、2.65個の根本要因に集約できた。 仕様への感度はモデルと実行基盤によって異なり、探索的なブートストラップによる交互作用の区間は、Revenueの3比較すべてと、Productivityの3比較のうち1つでゼロを含まなかった。実行時に具体化されるテンプレートは、評価した構成間で再利用可能な回帰テストの範囲を提供した。実際のAPIの変化の下での長期的な検証は、今後の課題として残る。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Enterprise AI agent skills evolve as tool APIs, models, and specifications change, yet final-output evaluation can miss process-level behavioral drift. We present a continuous evaluation framework combining outcome-level and process-level checks, applied to Revenue and Productivity variants of a Business Value Determination skill in an enterprise Value Aware Resiliency system. The framework independently computes per-run ground truth, materializes reusable template tests, and evaluates tool selection, arguments, execution order, and database integrity through programmatic checks and a narrowly scoped LLM judge. We evaluate 240 trials across two skills, two specification variants, two agent harnesses, and three models. Of 175 trials passing all applicable final numerical checks, 162 (92.6 percent; Wilson 95 percent CI: 87.7-95.6 percent) contained another evaluator-detected deviation. Under a broader seven-check final-state definition, 151 of 164 passing runs (92.1 percent; 95 percent CI: 86.9-95.3 percent) still violated a trajectory check. Dependency attribution reduced a mean of 6.34 failed checks per run to 2.65 roots. Specification sensitivity varied by model and harness, with exploratory bootstrap interaction intervals excluding zero for all three Revenue comparisons and one of three Productivity comparisons. Runtime-resolved templates provided reusable regression coverage across the evaluated configurations; longitudinal validation under actual API evolution remains future work.

著者のコメント

Accepted to Workshop on Continual Learning for Enterprise AI Agents (CLEA), NeurIPS 2026

arXiv ID: 2610.01833 / 要約の誤りについて