arXiv論文メモ
新着一覧
cs.RO / cs.AI · 査読状況未確認

人型ロボットの作業失敗を監視するFRAMESの初期評価

FRAMES: Failure Recovery And Monitoring of Embodied Skills for Humanoid Loco-Manipulation

Ajay Vikram Periasami, Xinyuan Luo, Haoyu Li, Xianyi Cheng

この論文をやさしく読む

ひとことで言うと

人型ロボットが物を運ぶ途中で失敗したかを確認し、失敗時に復旧担当へ情報を渡す仕組みです。今回評価したのは、そのうち失敗を監視する部分です。

何に役立つ?

考えられる用途は、長い作業の途中で失敗を放置せず、再計画や復旧につなげることです。今回の数値は監視器の判定能力を評価する材料になります。

この研究の面白いところ

複数視点の時系列画像だけでなく、ロボットの状態や接触の情報を組み合わせます。失敗検出と成功判定の件数を分けて報告しています。

どこまで分かった?

MuJoCo内の100試行による監視モジュール単体の結果です。復旧ループ全体の評価は継続中であり、94.0%を作業全体や実機での復旧成功率と解釈することはできません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)による計画器は、自然言語の指示を分解して再利用可能なロボットのスキルを選択できるが、正しいスキルを選んでも物理的な実行の成功は保証されない。この隔たりは人型ロボットの移動と物体操作で特に重要である。接近、把持、運搬、配置の途中で生じた誤りが、長期的な計画の残りを無効にしうるためだ。 Unitree G1人型ロボットを対象に、CEER全身制御器の上位で動作し、失敗を考慮する監督の枠組みFRAMESを提示する。Planner Agentはパラメータ化された中位レベルのスキルを通じて部分タスクを選び、視覚言語モデルに基づくMonitor Agentは、時系列の複数視点の観測と、構造化されたロボットおよび接触の情報を用いて各スキルを評価する。失敗を検出すると実行中のスキルを停止し、根拠に基づくフィードバックをRecovery Agentに渡す。この枠組みには、過去のスキル経験を再利用するMemory Moduleと、深度および領域分割を利用した幾何学的な対応付けも含まれる。 MuJoCoを用い、5つのタスクにわたる失敗50回と成功50回、計100回の試行で、枠組みの監視モジュールを独立に評価した。監視器は50件の失敗中48件を検出し、50件の成功中46件を正しく受け入れ、全体の正解率は94.0%だった。これらは監視部分についての初期的な証拠であり、復旧ループ全体の端から端までの評価は継続中である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language model (LLM) planners can decompose natural-language instructions and select reusable robot skills, but choosing the correct skill does not guarantee successful physical execution. This gap is especially important in humanoid loco-manipulation, where errors during approach, grasping, transport, or placement can invalidate the remainder of a long-horizon plan. We present FRAMES, a failure-aware supervisory framework for the Unitree G1 humanoid that operates above the CEER whole-body controller. A Planner Agent selects subtasks through parameterized mid-level skills, while a vision-language-model-based Monitor Agent evaluates each skill using temporal multi-view observations and structured robot and contact evidence. Detected failures stop the active skill and provide grounded feedback to a Recovery Agent. The framework further includes a Memory Module for reusing prior skill experience, and geometric grounding via depth and segmentation. We independently evaluate the monitoring module of the framework in MuJoCo using 100 trials comprising 50 failed and 50 successful executions across five tasks. The monitor detects 48 of 50 failures, correctly accepts 46 of 50 successful executions, and achieves 94.0% overall accuracy. These results provide initial evidence for the monitoring component, while end-to-end evaluation of the complete recovery loop remains ongoing.

著者のコメント

Accepted for poster presentation at the IROS 2026 Workshop on Full-Shift Robot Co-Workers: Active Perception and Interaction for Human Environments

arXiv ID: 2609.22538 / 要約の誤りについて