arXiv論文メモ
新着一覧
cs.CV / cs.HC · 査読状況未確認

動画から気の利いた支援を判断するロボットの評価基盤

RobotEQ-Video: A Video-Centric Benchmark for Social Proactive Intelligence with World-State Taxonomy

Xinyi Che, Zheng Lian, Kuofei Fang, Xuehao Wang, Xinghai Gao, Junqing Wu, Chuyu Wu, Liyi Liu, Yanhan Huang, Keyi Xie, Haomin Ouyang, Jinyang Wu, Fan Zhang, Runhao Zeng, Xun Yang, Bin He

この論文をやさしく読む

ひとことで言うと

人を手伝うロボットが、作業を終わらせるだけでなく、その場にふさわしい行動を選べるかを動画で評価します。人の動きや状況の変化を手掛かりに、先回りした支援の適切さを判断する課題です。

何に役立つ?

支援ロボットやAIの社会的な判断を比較し、苦手な場面を見つけるための評価基盤になります。状況を階層的に分類することで、データが特定の場面に偏っていないかを検討できます。

この研究の面白いところ

動画を増やすだけでなく、6領域から816個の細かな属性へ至る分類体系を用意しています。場面の多様性を意識して評価データを構成する点が特徴です。

どこまで分かった?

要旨では現行システムが人間の性能に届かないと報告されていますが、具体的な得点差はありません。世界モデルの利用も探索段階の記述であり、適切な支援が常にできるシステムを完成させたという結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

社会的な先回り知能(Social Proactive Intelligence、SPI)は、多様な身体を伴う場面で、先回りした支援を単なる課題の完了にとどめず、社会的な適切さも考慮するものへ拡張する。しかし、従来のSPI研究には2つの大きな限界がある。第1に、既存研究は静止画像に焦点を当てているが、動的な動画には人の状態やニーズを推測する重要な手掛かりがあり、単独の画像より豊かな情報を提供する。第2に、従来研究は自由形式のデータ収集手順に頼ることが多く、多様な状況を包括的に網羅することを保証できない。 これらの不足に対応するため、画像中心から動画中心の分析へ焦点を移すRobotEQ-Videoを導入する。動画の包括的な網羅性を確保するため、粗い分類から細かい分類へ進む4階層の世界状態分類体系を構築する。この体系は6領域、20次元、142個の第1水準属性、816個の第2水準属性からなる。完成したベンチマークには、2,000本を超える動画、10万件を超える人手の注釈、行動の適切さを評価するための1万6,000件を超えるラベルが含まれる。 ベンチマーク評価から、現在のシステムは依然として信頼性が低く、人間の性能に届かないことが分かった。さらに、世界モデルがこの課題にどのように役立つかを探る。本研究は、SPI研究を静止画像から動的な動画へ進め、ベンチマークの作成時により包括的な状況の網羅を確保するものである。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Social Proactive Intelligence (SPI) extends proactive assistance beyond task completeness to consider social appropriateness in diverse embodied scenarios. However, prior SPI research faces two key limitations. First, existing work focuses on static images, whereas dynamic videos provide crucial cues for inferring human states and needs, offering richer information than isolated images. Second, prior work often relies on free-form data collection pipelines, which fail to guarantee comprehensive coverage of diverse scenarios. To address these gaps, we introduce RobotEQ-Video, shifting the focus from image-centric to video-centric analysis. To ensure comprehensive video coverage, we construct a hierarchical world-state taxonomy organized into a four-level coarse-to-fine structure, comprising 6 domains, 20 dimensions, 142 level-1 attributes, and 816 level-2 attributes. The resulting benchmark comprises 2K+ videos with 100K+ human annotations and 16K+ labels for assessing behavior properness. Benchmark evaluation reveals that current systems remain unreliable and fall short of human performance. We further explore how world models can help tackle this task. This work advances SPI research from static images to dynamic videos and ensures more comprehensive scenario coverage during benchmarking.

arXiv ID: 2609.21371 / 要約の誤りについて