シミュレーション練習でロボットの技能と指示を改善する
Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
この論文をやさしく読む
ひとことで言うと
ロボットがシミュレーションで練習し、失敗に応じて使う技能や指示文を修正する方法です。基盤モデルの重みを変えず、周囲の実行システムを改善します。
何に役立つ?
考えられる用途は、物体操作ロボットの技能開発に必要な人手の削減です。シミュレーションの22タスクと、較正・機器適応後の三つの実機タスクで評価しています。
この研究の面白いところ
一つのタスクで良くなった変更をすぐ残すのではなく、個別の変更と統合版を別タスクでも検査します。学習の対象をモデルの重みから、再利用可能な技能とプロンプトへ移しています。
どこまで分かった?
実機での全成功は三つのタスク各10回、計30回の結果です。任意のタスクで成功を保証するものではありません。実機評価の前に較正とハードウェアへの適応を行い、練習ではシミュレーターの内部状態も使っています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
多様なタスクで信頼できるロボット能力を構築するには、技能の開発・維持、報酬の設計、知覚と制御の統合に大きな人手が必要である。本研究では、モデルの重みを更新せずにロボット実行システムを自律的に改善する枠組み、Reconstruct, Practice, Go Real(RPG)を提示する。RPGはオフラインのデータセットから物体操作の能力を見いだし、関連する練習タスクをシミュレーション内に構築する。 練習中、RPGは実行のフィードバック、シミュレーターだけが利用できる内部状態、利用可能なデータセットの動画を用いて失敗を診断する。その診断に基づき、新しい再利用可能な記号的技能を開発し、既存の技能を改善し、システムプロンプトを修正する。タスクをまたぐ評価によって、候補となる個々の変更と、変更を統合した改訂を検査してから、再利用するために保持する。テスト時には、マルチモーダルLLMが得られたシステムプロンプトと技能ライブラリを用い、知覚とロボット制御を統括する。 22の物体操作タスクで、練習に含まれない初期条件を使って評価すると、RPGは最初の練習ラウンド後の成功率28.6%を、15ラウンド後に95.0%まで向上させた。ASPIRE(75.5%)とGPT-6 Astra Proを用いたCaP-Agent0(60.0%)を含む、評価したすべてのベースラインを上回った。共通の較正とハードウェア適応の手順を経た後、固定したシステムは三つのタスクを各10回、合計30回行った実機試行のすべてに成功した。プロジェクトサイトはhttps://rpg-robot.github.io/である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Building reliable robot capabilities across diverse tasks requires substantial human effort to develop and maintain skills, design rewards, and integrate perception with control. We present Reconstruct, Practice, Go Real (RPG), a framework for autonomous improvement of robot execution systems without updating model weights. RPG identifies manipulation capabilities in an offline dataset and constructs related practice tasks in simulation. During practice, RPG uses execution feedback, privileged simulator state, and available dataset videos to diagnose failures. It develops new reusable symbolic skills, refines existing skills, and revises the system prompt based on these diagnoses. Cross-task evaluation tests individual candidate changes and merged revisions before they are retained for reuse. At test time, a multimodal LLM uses the resulting system prompt and skill library to coordinate perception and robot control. On held-out initializations of 22 manipulation tasks, RPG improves task success from 28.6% after the first practice round to 95.0% after 15 rounds, outperforming all evaluated baselines, including ASPIRE (75.5%) and CaP-Agent0 powered by GPT-6 Astra Pro (60.0%). After a common calibration and hardware-adaptation procedure, the frozen system succeeds in all 30 physical trials, with ten trials on each of three tasks. Project Website: https://rpg-robot.github.io/
著者のコメント
17 pages, 6 figures, 10 tables
arXiv ID: 2610.02204 / 要約の誤りについて