ロボットAIの入力変化と動作履歴から失敗を予測
VLA-Scope: Shift-Aware Failure Prediction for Vision-Language-Action Models
この論文をやさしく読む
ひとことで言うと
見慣れない状況かどうかに加え、ロボットがそこまでどう動いたかを見ることで、作業の失敗を予測する研究です。状況が未知でも成功できる場合を、単なる異常入力検出と分けて扱います。
何に役立つ?
考えられる用途は、失敗リスクが高まった際に作業を止めたり、人の確認を求めたりする判断の補助です。今回示されたのは失敗予測の性能であり、その介入による安全性向上を実証したものではありません。
この研究の面白いところ
静止した入力だけでなく、動作中に蓄積する進捗情報を使う点が特徴です。60行動後のROC-AUCは進捗情報なしの0.7906から0.8497へ改善しました。
どこまで分かった?
評価はOpenVLAを用いたLIBERO-Spatialの10タスクです。失敗予測の数値はOOD判定を通過した例だけでなく、全1,400件のOOD実行で独立に評価した値であり、2段階全体の性能と混同できません。実環境での評価は要旨に記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚・言語・行動(VLA)モデルは、視覚観測と自然言語の指示をロボットの行動へ変換するが、分布の変化によって信頼性が損なわれることがある。一方、学習時の分布から外れた(OOD)条件でも成功する場合があるため、OOD入力の検出だけでは実行の失敗を予測するには不十分である。本論文では、入力分布の変化の特徴付けと実行履歴を組み合わせ、OOD条件での一連の実行中に失敗を予測する2段階の枠組みVLA-Scopeを導入する。 第1段階では、集約した画像表現と言語表現を使ってOOD入力を検出し、その変化の種類を分類する。OODと判定された入力について、第2段階では予測した種類、実行済みの行動列の特徴、実行の進捗の特徴を組み合わせる。変化の種類をまたいで共通に用いるロジスティック回帰モデルが、実行の進行に応じて失敗リスクを更新する。 OpenVLAとLIBERO-Spatialの10タスクを用い、1グループずつ除外する交差検証で評価した。OOD検出のROC-AUCは0.9454、変化の種類の分類精度は91%だった。OOD判定による振り分けとは独立に、全1,400件のOOD実行で評価した失敗予測器は、60回の行動実行後にROC-AUC 0.8497を達成した。実行進捗の特徴を使わない場合は0.7906だった。また、評価対象のActProbeおよびSAFE-MLPベースラインより高いROC-AUCを得た。これらの結果は、行動の特徴と、実行ステップの表現を時間方向に集約した特徴を組み合わせることで、入力変化のもとでの失敗予測が改善することを示唆している。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Vision-language-action (VLA) models map visual observations and natural-language instructions to robotic actions, but distribution shifts can compromise their reliability. Because these models may still succeed under out-of-distribution (OOD) conditions, detecting OOD inputs alone is insufficient to predict execution failure. In this paper, we introduce VLA-Scope, a two-stage framework that combines input-shift characterization with execution history to predict failure during OOD rollouts. The first stage uses pooled image and language representations to detect OOD inputs and classify their shift categories. For inputs flagged as OOD, the second stage combines the predicted category, action-prefix features, and execution progress features. A logistic regression model shared across shift categories updates failure risk as execution proceeds. We evaluate the framework with OpenVLA on ten LIBERO-Spatial tasks using leave-one-group-out cross-validation. OOD detection achieves a ROC-AUC of 0.9454, and shift classification achieves 91% accuracy. Evaluated independently of the OOD gate on all 1,400 OOD rollouts, the failure predictor achieves a ROC-AUC of 0.8497 after 60 executed actions, compared with 0.7906 without execution progress features. It also achieves a higher ROC-AUC than the evaluated ActProbe and SAFE-MLP baselines. These results suggest that combining action features with temporally aggregated execution step representations improves failure prediction under input shifts.
著者のコメント
9 pages, 3 figures
arXiv ID: 2609.21246 / 要約の誤りについて