arXiv論文メモ
新着一覧
cs.RO / cs.CV · 査読状況未確認

視覚デモと能動知覚で測る身体的空間知能

VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

Zhongbo Zhang, Jiayi Jin, Yifan Wang, Zaibin Zhang, Haiwen Diao, Lijun Wang, Huchuan Lu

この論文をやさしく読む

ひとことで言うと

画像から物の位置を答えるだけでなく、足りない視点を取りに行き、実際の動作指示を出し、結果を見て直す能力を測る評価基盤です。空間を説明する力と行動を成功させる力の差を測ります。

何に役立つ?

汎用の画像・言語モデルをロボット操作に使う際、どの段階で失敗するかを比較するために役立ちます。視点選択、位置関係の理解、動作の修正を同じ流れの中で評価できます。

この研究の面白いところ

正解の物体姿勢や軌道を与えず、モデル自身が指定した目標だけを固定制御器が実行します。ある比較では能動的なカメラ制御によって成功率が27.86%から57.50%へ向上しています。

どこまで分かった?

最良モデルでも3回の平均タスク成功率は53.93±3.17%です。未見の形状では30ポイント超低下する場合があり、厳格な長期タスクを完了したモデルはありません。位置特定の正答率100%と全体成功を混同できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

空間知能には、物体の位置を説明するだけでは足りない。観測が不完全なとき、モデルは不足する証拠を特定して取得し、それを共通の空間基準で解釈し、行動してから結果に基づいて修正しなければならない。本研究では、この観測・推論・行動・修正の一連のループを評価するVA-Benchを導入する。汎用マルチモーダル大規模言語モデル(MLLM)は、RGBのみのデモンストレーションから手順的な文脈を学び、カメラ視点を能動的に選び、メートル単位の直交座標コマンドを出し、実行フィードバックに基づきそれを修正する。モデルには特権的な物体姿勢、正解軌道、学習済み行動ヘッドを与えない。モデルが指定した目標だけを固定のモデル非依存コントローラが実行する。VA-Benchには14の基本タスク群(片腕11、両腕3)、7つの未見の幾何・配置バリエーション、5物体を扱う長期構成トラックがある。12の主要モデル条件を、基本タスクごとに同じ20個の物理検証済みシードを用いて独立に3回評価し、最終成功率、軌道レベルの9つの行動診断指標、サブタスク進捗を報告する。 注釈付き実行では、最良モデルの目標位置特定スコアは100.0%、空間関係スコアは78.9%だった。しかし3回実行のタスク成功率のマクロ平均は53.93±3.17%にとどまった。能動的なカメラ制御は、受動的な多視点観測よりタスク成功率を有意に改善し、対応する比較では成功率が27.86%から57.50%へ上昇した。未見の幾何への転移では、タスク成功率が30ポイントを超えて低下することがあった。長期タスクでは、部分的に大きく進んでも、厳密なエピソードを完了したモデルはなかった。VA-Benchは、汎用MLLMが視覚デモと能動的に取得した証拠を成功する身体的行動へ変換できるかを検証する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Spatial intelligence requires more than describing object locations. Under incomplete observation, models must identify and acquire missing evidence, interpret it in a common spatial frame, and act on it. We introduce VA-Bench to evaluate the complete observe-reason-act-revise loop. General-purpose MLLMs learn procedural context from RGB-only demonstrations, actively select camera viewpoints, issue metric Cartesian commands, and revise them from execution feedback. Models receive no privileged object poses, oracle trajectories, or learned action heads. A fixed model-agnostic controller executes only model-specified targets. VA-Bench contains 14 base task families (11 single-arm and three dual-arm), seven held-out geometry/layout variants, and a long-horizon five-object composition track. We evaluate 12 primary model conditions in three independent runs over the same 20 physically verified seeds per base task, reporting terminal success, nine trajectory-level behavioral diagnostics, and subtask progress. First, the best-performing model scores 100.0% on target localization and 78.9% on spatial relations in the annotated run. Its three-run macro-average task success is only 53.93+/-3.17%. Second, active camera control significantly improves task success over passive multi-view observation. In one matched comparison, success rises from 27.86% to 57.50%. Third, held-out geometric transfer can reduce task success by over 30 percentage points. No model completes a strict long-horizon episode, despite substantial partial progress. VA-Bench thus tests whether general-purpose MLLMs can turn visual demonstrations and actively acquired evidence into successful embodied action.

arXiv ID: 2609.19554 / 要約の誤りについて