ツール利用エージェントの行動を根拠付きで注釈する手順
Canonical Procedural Actions: An Auditable Annotation Protocol for Tool-Use Agent Traces
この論文をやさしく読む
ひとことで言うと
エージェントの記録を「何のための行動か」という単位で整理し、判断の根拠になったイベントもたどれるようにする注釈手順です。
何に役立つ?
ツール利用の手順を監査したり比較したりするための記録形式として使うことが考えられます。下流の分析でどれほど役立つかは未確立です。
この研究の面白いところ
高い一致率をそのまま意味理解の正確さとせず、ラベルを潰した場合や単純ルールの対照も試しています。文脈の参照まで合わせると一致度が下がる点も示します。
どこまで分かった?
軌跡は開発用と分離されていますが、タスクIDの16/26は重複し、過去のツール内容は110文字に切り詰められています。人の正解との妥当性検証は残っており、0.982は意味的正解率ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ツール利用エージェントの実行記録はメッセージとAPI呼び出しを特定するが、手続きの解析には、明示的な行動単位と、その証拠を確認できる対応付けも必要である。本研究では、手続き上の機能、その最初のエージェントイベントを示すアンカー、機能を実現するエージェントイベント、そして別枠の文脈的証拠を記録する注釈プロトコルCanonical Procedural Actions(CPA)を提示する。複数の行動が同じメッセージのアンカーを共有しても、メッセージ内部の順序は推測しない。小売の事例研究では、開かれた帰納的整理、記録を残した統合、段階的な適用監査を通じて、版管理された24項目のコードブックを作成する。 互いに隔離された2つのLLMコンテキストで、開発用とは軌跡単位で重複しない32軌跡を注釈し、それぞれ499件と491件の出現を得た。アンカーとラベルの重なりはA=0.982だった。文脈イベントの参照も同一であることを要求すると、重なりは0.798へ低下した。これらは構造的な再現性の指標であり、意味的な正確さではない。26個のタスクIDのうち16個は開発データにも存在し、過去のツールのペイロードは110文字に切り詰められていた。事後的な対照評価では、すべてのラベルをまとめると重なりは0.986へ上がり、単純なエンドポイント規則でもツールをアンカーとする部分を0.997の重なりで再現した。アシスタントメッセージに対応する行動の重なりは0.971で、ラベルごとの最小値は0.816だった。固定したコードブックをさらに244軌跡へ適用すると、8件の診断的な結果を含む4,058件の記録を得た。本研究の貢献は、明示的で監査可能な注釈の手段と、その構築過程および測定上の限界の事例研究にある。人による参照との照合に基づく妥当性と、下流用途での有用性は、今後確立する必要がある。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Tool-use agent traces identify messages and API calls, but procedural analyses also need explicit units of action and inspectable links to their evidence. We present Canonical Procedural Actions (CPAs), an annotation protocol that records a procedural function, its first agent-event anchor, the agent events that realize it, and separate contextual evidence. Multiple actions may share a message anchor without an inferred within-message order. A retail case study produces a versioned 24-entry codebook through open induction, recorded consolidation, and successive application audits. Two isolated LLM contexts annotate 32 trajectories disjoint from development at the trajectory level, producing 499 and 491 occurrences with anchor-label overlap A=0.982. Requiring identical context-event references reduces overlap to 0.798. These are structural repeatability measures, not semantic accuracy: 16 of 26 task IDs also occur in development, and historical tool payloads were truncated to 110 characters. Retrospective controls show that collapsing all labels raises overlap to 0.986, while simple endpoint rules reproduce the tool-anchored portion with 0.997 overlap. Assistant-message actions have 0.971 overlap, with a per-label minimum of 0.816. Applying the frozen codebook to 244 further trajectories yields 4,058 records, including eight diagnostic outcomes. The contribution is an explicit, auditable annotation instrument and a case study of its construction and measurement limits; human-reference validity and downstream utility remain to be established.
著者のコメント
23 pages, 5 figures, 9 tables. Includes ancillary files for reproducing the reported analyses
arXiv ID: 2609.24264 / 要約の誤りについて