arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

ロボット作業の前・途中・後の危険を分けて評価

SafeStage: Evaluating Safety Before, During, and After Vision-Language-Conditioned Robot Manipulation

Jinzhu Luo, Qi Zhang, Wei Wang, Wei Jiang

この論文をやさしく読む

ひとことで言うと

ロボットが指示を達成しても安全とは限らないため、作業開始前、動作中、完了後の危険を別々に採点する評価集です。97のリスク場面を用意しています。

何に役立つ?

どの方策がどの段階で危険を生みやすいかを調べ、改善対象を見つけるのに役立ちます。成功率だけでは見えない、置いた後の不安定さなども評価対象になります。

この研究の面白いところ

タスク成功を安全性の代理にせず、独立した結果として報告します。異なる方策が、初期・実行中・最終の各段階で異なる弱点を持つことを示しています。

どこまで分かった?

要旨は安全違反との併存を報告しますが、具体的な違反率は示していません。97の設計シナリオによる評価であり、あらゆる実環境の安全を保証する認証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚と言語を条件とするロボット方策は、汎用的な操作のために知覚、言語理解、制御を統合する。しかし、既存の評価は、タスク成功、個別の物理的制約、意味的な拒否、または実際に生じた物理的損傷に注目することが多く、閉ループ操作のどこで安全性が損なわれるかについて得られる知見は限られる。本研究では、タスク実行の前、途中、後の操作安全性を評価する、ライフサイクルに沿って構成したベンチマークSafeStageを導入する。 SafeStageは、3段階に整理された、専用に設計した97のリスクシナリオを含む。初期状態の危険は、対象物を操作する前に解決すべき安全上重要な関係を扱う。実行中の安全性は、実行中の危険な接触、軌道、領域への進入、物体間の相互作用を評価する。最終状態の危険は、名目上のタスク完了後に残る不安定な状態やその他の危険な状態を捉える。ベンチマークは、イベントに基づく検査と状態に基づく検査で実際に生じた相互作用を評価し、本来のタスク成功を段階別の安全性の結果と独立に報告する。 共通の閉ループ手順のもとで、代表的な直接行動型の視覚・言語・行動(VLA)方策と、世界モデルに基づく方策を評価する。結果は、名目上のタスク完了と安全違反が頻繁に同時に生じ、方策によって3段階の失敗傾向が異なることを示している。タスク成功と安全性を分離し、違反が起きる時点を特定することで、SafeStageは視覚言語条件付きロボット操作方策を評価・改善するための統一的な診断環境を提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-language-conditioned robot policies integrate perception, language understanding, and control for general-purpose manipulation. However, existing evaluations often focus on task success, isolated physical constraints, semantic refusal, or realized physical damage, providing limited insight into where safety fails during closed-loop manipulation. We introduce SafeStage, a lifecycle-structured benchmark for evaluating manipulation safety before, during, and after task execution. SafeStage contains 97 purpose-built risk scenarios organized into three stages. Initial-State Hazards captures safety-relevant relations that must be resolved before manipulating the target. Execution-Time Safety evaluates unsafe contacts, trajectories, region entries, and object interactions during execution. Final-State Hazards capture unstable or otherwise unsafe conditions remaining after nominal task completion. The benchmark evaluates realized interactions using event-based and state-based checks and reports native task success independently from stage-specific safety outcomes. We evaluate representative direct-action Vision-Language-Action (VLA) policies and policies with world-model-based policies under a common closed-loop protocol. Our results demonstrate that nominal task completion frequently coexists with safety violations and that different policies exhibit distinct failure profiles across the three stages. By separating task success from safety and localizing when violations occur, SafeStage provides a unified diagnostic testbed for evaluating and improving vision-language-conditioned robot manipulation policies.

arXiv ID: 2609.21223 / 要約の誤りについて