arXiv論文メモ
新着一覧
cs.AI / cs.SE · 査読状況未確認

実行前にエージェント用スキルを評価する4次元の枠組み

MCRI: A Four-Dimensional Framework for Analyzing and Evaluating Agent Skills

Zongrui Yang, Li Xintong, Runchen Xu, Zhongsheng Wang, Zhedong Lin, Haoyuan Li, Jiamou Liu

この論文をやさしく読む

ひとことで言うと

エージェントに追加するスキルを、実際に大量実行して比べる前に評価し、有望な候補を選ぶ方法です。

何に役立つ?

多数の公開スキルから実行評価する候補を絞り込む際に役立ちます。3つのベンチマークで、選ばれたスキルの下流性能の順位が改善しています。

この研究の面白いところ

人気との相関だけでなく、スキルを使ったモデルの実行結果との順位の一致まで評価しています。実行前のスコアが実際の選択に使えるかを調べた点が特徴です。

どこまで分かった?

報告された改善は性能そのものの正解率の差ではなく、性能順位のパーセンタイルポイントです。4次元それぞれの定義や評価費用の詳細は要旨には記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

エージェントが単一ツールのシステムから、モジュール化された複合的な構成へと進化するにつれ、スキルは能力の開発と配布の重要な仕組みになっている。しかし、学術界にはスキルを体系的に分析・評価するための構造化された枠組みが不足している。情報利得と行動上の制約を基に、4次元のMCRIフレームワークを提案し、それを大規模言語モデルによる評価方法MCRI-Evalとして具体化する。 OpenClaw skill Hubで公開されている63,812件のスキルを用い、BigCodeBench、BFCL-Fundamental、Mind2Webで、スキルを条件として与えた58,275回のモデル実行を通じてMCRI-Evalを評価する。MCRI-Evalのスコアはコミュニティーでの人気を示す指標と正に関連し、比較した方法の中で下流タスクの順位との一致度が最も高い。また、3つのベンチマークすべてで、最上位のスキル1件を選ぶ性能を改善する。各ベンチマークで最も強いベースラインと比べると、MCRI-Evalが選んだスキルの下流性能の順位は、BigCodeBench、BFCL-Fundamental、Mind2Webでそれぞれ17.7、22.8、19.6パーセンタイルポイント上昇する。これらの結果は、費用のかかる実行による評価に先立ち、有望なスキルを優先するための有用な実行前指標をMCRI-Evalが提供することを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

As agents evolve from single-tool systems into modular, composite architectures, skills are becoming an important mechanism for capability development and distribution. However, the academic community lacks a structured framework for systematically analyzing and evaluating skills. Drawing on information gain and behavioral constraint, we propose the four-dimensional MCRI Framework and operationalize it as MCRI-Eval, a large language model-based evaluation method. We evaluate MCRI-Eval using 63,812 public skills from the OpenClaw skill Hub, with 58,275 skill-conditioned model executions across BigCodeBench, BFCL-Fundamental, and Mind2Web. MCRI-Eval scores are positively associated with community popularity signals and achieve the highest downstream ranking agreement among the evaluated methods. MCRI-Eval also improves top-1 skill selection across all three benchmarks: compared with the strongest baseline on each benchmark, the skills selected by MCRI-Eval advance by 17.7, 22.8, and 19.6 percentile points in downstream performance rank on BigCodeBench, BFCL-Fundamental, and Mind2Web, respectively. These results indicate that MCRI-Eval provides a useful pre-execution signal for prioritizing promising skills before costly execution-based evaluation.

著者のコメント

24PAGES

arXiv ID: 2610.01506 / 要約の誤りについて