arXiv論文メモ
新着一覧
cs.RO / cs.CV · 査読状況未確認

視覚の乱れに対するロボット基盤モデルの弱点を評価

LIBERO-VPro: Benchmarking Closed-Loop Visual Robustness of Robotic Foundation Models

Huiqiong Li, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Yu-Gang Jiang, Bin Zhu

この論文をやさしく読む

ひとことで言うと

ロボットが見ている画像が古い、欠ける、局所的に乱れるといった状況で、作業を続けられるかを調べる評価です。普通の条件で高得点でも、視覚情報を十分使えているとは限らないと示しています。

何に役立つ?

ロボットモデルの評価で、標準課題の成功率だけでは見つけにくい弱点を洗い出すために役立ちます。視覚入力の劣化や環境変化への対応を、複数の条件で比較できます。

この研究の面白いところ

物体が大きく隠れても成功する一方、接触付近の小さな手がかりや慣れた配置の変化に弱いことがあります。単純な画像の見やすさだけでは性能を説明できません。

どこまで分かった?

約196,000回はシミュレーションで、実機試行は200回です。評価した6モデルで頑健性の傾向が異なり、特定の構成がすべての視覚条件で優れるという結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

ロボット基盤モデルは標準的な操作ベンチマークで優れた性能を示すが、こうした評価では通常、実行中を通して、明瞭で遅れがなく、一貫した視覚観測が得られることを仮定している。本研究では、実行中に利用可能な視覚的証拠へ摂動を加えることで、ロボット基盤モデルの閉ループ視覚頑健性を体系的に評価するベンチマークLIBERO-VProを導入する。 LIBERO-VProは、視覚証拠の劣化、カメラ情報の古さ、視覚情報源の一貫性、課題に関係するシーンの変化という、相補的な四つの観点を扱う。12種類の課題カテゴリー、96の実験設定、3,296の課題・条件の組合せを含む。3つの視覚・言語・行動モデルと3つの世界・行動モデルを、約196,000回のシミュレーションエピソードで評価し、Franka Research 3による200回の実機試行で補完する。 結果は、通常条件での高性能の陰に、視覚に基づく判断と適応の大きな弱点が隠れていることを明らかにする。モデルは物体レベルで強い遮蔽があっても成功を維持することが多い一方、局所的な相互作用の手がかりが乱されたり、見慣れた空間配置の事前知識が通用しなくなったりすると、急激に性能が低下する。また、古い観測や欠落した観測に極めて敏感であり、課題の前提条件が変わって行動の適応が必要になると苦戦する。最後に、VLAとWAMは異なる頑健性の傾向を示し、視覚頑健性が多次元的で構成に依存することが分かる。LIBERO-VProは、難しい視覚条件でも、観測により確実に根拠づけて行動を適応させるロボット基盤モデルの開発へ向け、体系的な診断枠組みを提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Robotic foundation models achieve impressive performance on standard manipulation benchmarks, yet these evaluations typically assume clean, timely, and consistent visual observations throughout execution. We introduce LIBERO-VPro, a benchmark for systematically evaluating the closed-loop visual robustness of robotic foundation models by perturbing the visual evidence available during execution. LIBERO-VPro covers four complementary dimensions, including Visual Evidence Degradation, Camera Staleness, Visual Source Consistency, and Task-Relevant Scene Variation, spanning 12 challenge categories, 96 experimental settings, and 3,296 task-condition cases. We evaluate three vision-language-action models and three world-action models over approximately 196,000 simulated episodes, complemented by 200 real-world rollouts on a Franka Research 3. Our results reveal that strong nominal performance can mask substantial weaknesses in visual grounding and adaptation. Models often remain successful despite severe object-level occlusion, yet degrade sharply when local interaction cues are disrupted or familiar spatial priors are violated. They are also highly sensitive to stale or missing observations and struggle when changed task preconditions require behavioral adaptation. Finally, VLAs and WAMs exhibit distinct robustness profiles, showing that visual robustness is multi-dimensional and architecture-dependent. LIBERO-VPro provides a systematic diagnostic framework for developing robotic foundation models that can more reliably ground and adapt their actions under challenging visual conditions.

著者のコメント

Project:https://huiqiongli.github.io/LIBERO-VPro/

arXiv ID: 2609.24350 / 要約の誤りについて