arXiv論文メモ
新着一覧
cs.CL / cs.AI / cs.LG · 査読状況未確認

パソコン操作AIの途中手順を評価するOSWorld-Pro

OSWorld-Pro: Process-based Evaluation for Computer Use Agents

Zhilin Wang, Shaokun Zhang, Yifan Zhang, Hao Zhang, Jin Xu, Binfeng Xu, Jian Hu, Yunheng Zou, Karan Sapra, Andrew Tao, Jan Kautz, Yi Dong

この論文をやさしく読む

ひとことで言うと

パソコンを操作するAIについて、最後に成功したかだけでなく、途中のどの小目標でつまずいたかを評価するベンチマークです。

何に役立つ?

入力ミス、クリックミス、関係のない行動などを分け、操作AIの改善すべき箇所を特定するために使えます。

この研究の面白いところ

300超のタスクを2,800超の下位目標に分け、人手注釈に基づくLLM判定器で途中の進捗を追います。最終成果物の採点では見えにくい失敗を扱います。

どこまで分かった?

75.7%と83.4%は要旨に報告された二つの評価環境での値です。評価にはLLM判定器を使っており、要旨にはその誤判定率の詳細はありません。掲載されたモデル名や値は論文の報告として紹介しています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

コンピューター操作エージェント(CUA)の評価は、OSWorldに見られるように、数百の操作を終えた後に作る最終成果物だけに限られ、機能的な検証器によって判定されることが多い。しかし、このような最終状態の性能評価では、さまざまなタスクでエージェントがどのように、なぜ失敗するかが見えず、その後の改善に重要な知見が得にくくなる。例えば、キーボード入力で誤るエージェントには、グラフィカルUIでクリック入力を正確に行えないエージェントとは異なる対策が必要になる。 本研究では、人手による67,000件超の注釈に基づき、CUAの手順を評価できるようにした、300件超のタスクと2,800件超の下位目標からなるOSWorld-Proを導入する。人間の判断と整合する頑健なLLM判定器を用いて、OSWorld-Proの下位目標の達成を評価し、順次依存する下位目標の列を通してモデルがどこまで進んだかを明らかにする。 結果は、OSWorld-Proが最先端のLLMにとっても難しいことを示している。Claude Opus 5のような上位モデルでも、OSWorldでの83.4%に対して75.7%にとどまる。さらに、下位目標と無関係な行動やクリックに関する誤りなど、各モデルの重要な過程上の失敗パターンを特定し、CUAの性能と効率の改善に向けた知見を提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Evaluation of Computer-Use Agents (CUAs) is often limited to the final deliverables they create (at the end of hundreds of steps) and assessed with functional verifiers, as seen in OSWorld. However, such evaluation of end-state performance lacks transparency into how and why agents fail in various tasks, obfuscating critical insight for subsequent improvement. For instance, agents that err during keyboard inputs would require a different mitigation strategy from those that fail to precisely provide click-based inputs on the graphical UI. We introduce OSWorld-Pro: a set of over 300 tasks containing over 2800 subgoals to enable the procedural evaluation of CUAs grounded in over 67,000 human annotations. We use robust human-aligned LLM-Judges to evaluate the fulfillment of OSWorld-Pro subgoals and thereby reveal the progress that models make throughout a series of sequentially dependent subgoals. Our findings reveal that OSWorld-Pro is challenging even for state-of-the-art LLMs, with top performers like Claude Opus 5 achieving only 75.7% vs. 83.4% on OSWorld. Furthermore, we identify critical process-focused failure modes of various models (e.g. subgoal-irrelevant actions and click-based mistakes) to provide insights to improve performance and efficiency of CUAs.

著者のコメント

27 pages, 7 figures

arXiv ID: 2609.24890 / 要約の誤りについて