arXiv論文メモ
新着一覧
cs.RO / cs.AI · 査読状況未確認

ロボットの頭部と両手首の動画予測の整合性を測るベンチマーク

TriWorldBench: A Tri-View Consistency Perspective on Embodied World Models

Xuanyi Liu, Haofeng Wang, Ruiqi Li, Danni Yu, Rui Wan, Ruixu Zhang, Siyu Tao, Xue Yang, Shaofeng Zhang, Zicheng Zhang, Jiaqi Zhang, Siwei Ma

この論文をやさしく読む

ひとことで言うと

ロボット行動の予測動画が、頭部と左右の手首という三つの視点で同じ出来事を表しているかを測る評価基盤。

何に役立つ?

考えられる用途は、ロボット世界モデルの予測の矛盾箇所を特定し、モデル比較に使うこと。要旨が示すのはベンチマークの構成であり、ロボット作業の成功率向上の実証ではない。

この研究の面白いところ

各視点が個別には自然に見えても、三視点を合わせると物体や行動が食い違う可能性に着目する。500エピソード、50作業、19指標を用意した。

どこまで分かった?

対象は頭部と両手首の同期動画による両手操作作業。要旨には個々の世界モデルの測定結果や実機での作業成績は示されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

身体を持つロボットの世界モデルは、学習や計画に役立てるため、ロボットの行動の結果を予測する。頭部と手首にカメラがあるロボットでは、頭部の映像が作業全体を捉え、手首の映像が把持器と物体の局所的な相互作用を捉えるという、補い合う視点が必要になる。しかし、それぞれの視点を独立に評価しても、同じ行動や物体の状態を描いているかは判断できない。そこで、同期した頭部、左手首、右手首の動画から世界モデルを評価するTRIWORLDBENCHを導入する。両手を使う50種類の操作作業にわたる500エピソードを含み、19の指標で三視点間の整合性、作業との一致、物理的・三次元的な一貫性、動きの質、時間的整合性、映像品質を評価する。視点間の照合と各カメラに合った測定を組み合わせ、個々の動画がもっともらしく見える場合でも、意図した作業について一貫した予測になっているかを調べる。総合性能はTWB-Scoreでまとめつつ、予測がどこで失敗したかを特定できるよう、視点ごとの結果も残す。これにより、世界モデルの評価を単一視点の映像品質から広げる。コード、データ、指標の定義を公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Embodied world models predict the outcomes of robot actions to support learning and planning. For robots equipped with head and wrist cameras, this requires complementary views: the head view captures the overall task, while wrist views reveal local gripper-object interactions. However, evaluating these views independently cannot determine whether they describe the same action and object state. We introduce TRIWORLDBENCH, a benchmark for evaluating embodied world models through synchronized head, left-wrist, and right-wrist videos. It contains 500 episodes across 50 bimanual manipulation tasks and uses 19 metrics to assess tri-view consistency, task alignment, physical and 3D coherence, motion quality, temporal consistency, and visual quality. By combining cross-view checks with measurements tailored to each camera, the benchmark evaluates whether plausible individual videos also form a consistent prediction of the intended task. We summarize overall performance with TWB-Score and retain per-view results to identify where predictions fail. This extends world-model evaluation beyond single-view visual quality. Code, data, and metric definitions are available at https://github.com/TriWorldBench/TriWorldBench.

arXiv ID: 2609.26314 / 要約の誤りについて