ロボットの失敗を再実行で検証し、回復行動を学ばせる
MAGMA-GEN: Validated Recovery Supervision from Ambiguous Failures via Counterfactual Re-Execution
この論文をやさしく読む
ひとことで言うと
ロボットが失敗した原因の仮説を、同じ状態から実際にやり直して確かめ、立て直し方の学習データに変えます。
何に役立つ?
長い操作作業で途中から回復できるロボットを学習させるために役立ちます。人が毎段階の見本を与えず、エージェント自身の失敗から教師データを得ます。
この研究の面白いところ
高い情報アクセスを持つコーチの診断も鵜呑みにせず、条件をそろえた再実行で後の進捗が改善した候補だけ採用します。判断の誤りと物理的な実行失敗を混同しにくくする設計です。
どこまで分かった?
シミュレーションと実機の両方で、蒸留や軌跡修復の比較手法に対する改善を報告しています。要旨には成功率の数値や再実行の費用はなく、コーチの診断も誤りうることを前提としています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
長い手順を要する物体操作タスクを実行する階層型ロボットシステムでは、確率的に振る舞う低水準スキルを統括する、高水準の意味的な意思決定が必要になる。この設定では、失敗した試行の解釈は曖昧である。後続状態が悪くなった原因は、高水準の判断が不適切だったことかもしれず、部分的な観測や、正しい判断に従った物理的な実行の失敗かもしれない。従来の教師あり学習には、このような回復を要する状態のデータが不足している。一方、強化学習では、疎な報酬と、離れた意思決定への功績・責任の割り当てが難しい。 本研究では、曖昧な失敗試行を、検証済みの回復用教師データへ変換するオンポリシーのデータ生成パイプラインMAGMA-GENを提案する。まず、特権的な情報にアクセスできるコーチが、早い段階の意思決定上の誤りについて仮説を立て、局所的な修正行動や回復行動を提案する。この診断は誤り得るため、同じ状態から条件を揃えて再実行し、後続の進捗が改善された候補だけを残す。これにより、人間が各ステップを実演しなくても、エージェント自身の失敗分布から教師あり学習用の事例を生成できる。 対話的で長い手順を要する物体操作タスクで評価したところ、変化するタスク制約の下で、MAGMA-GENは蒸留および軌跡修復のベースラインと比べ、シミュレーションと実機ロボットでの実行の両方で、タスク成功率と回復能力を改善した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 掲載先の記載あり
著者による掲載先の記載:10th Conference on Robot Learning (CoRL 2026), Conference on Robot Learning (CoRL), Nov 2026, Austin (Texas, USA), United States。出版社での独立確認は未実施です。
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Hierarchical robotic systems executing long-horizon manipulation tasks must make high-level semantic decisions that orchestrate stochastic low-level skills. In this setting, failed rollouts are ambiguous: a poor downstream state may reflect an invalid high-level decision, partial observation, or a valid decision whose physical execution failed. Traditional supervised learning lacks data for such recovery states, while reinforcement learning struggles with sparse rewards and non-local credit assignment. We propose MAGMA-GEN, an on-policy data-generation pipeline that converts ambiguous failed rollouts into validated recovery supervision. MAGMA-GEN first uses a privileged coach to hypothesize an early decision-level error and propose localized correction or recovery actions. Because this diagnosis is fallible, candidates are retained only if re-execution from the same state under matched conditions improves downstream progress. This produces supervised examples from the agent's own failure distribution without per-step human demonstrations. Evaluated on interactive long-horizon manipulation tasks, MAGMA-GEN improves task success and recovery capabilities, against distillation and trajectory-repair baselines under evolving task constraints in both simulation and real-robot execution.
arXiv ID: 2609.20056 / 要約の誤りについて