動く物体のロボット操作実演を生成するDynaForge
DynaForge: Planning-Guided Residual Learning for Dynamic Manipulation Demonstration Generation
この論文をやさしく読む
ひとことで言うと
動く物体を扱うロボット向けに、計画を基礎にして接触中の行動を学習で補正し、訓練用の実演を作る方法を示した。
何に役立つ?
動的なロボット操作方策を学習するための実演データ作成に役立つ可能性がある。現実世界の作業でも比較した結果が報告されている。
この研究の面白いところ
シミュレーション9作業で実演生成の平均成功率が41.30%から78.37%に上がった。作成した実演で学習したDP3方策も、比較対象の実演で学習した場合より高い成功率だった。
どこまで分かった?
実世界での評価は三つの動的作業で、DynaForge方策の成功率は30~60%だった。すべての動的操作で安定して成功する段階ではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
実世界で働くロボットには、動く物体の操作が重要だが、質の高い実演を生成する方法は限られている。静的な作業向けの方法は、動的な場面にそのまま移せない。動的な実演生成でも、計画に基づく方法は接触の近くで失敗し得る。一方、DOMINO型の再生は動的な相互作用を単純化するため、方策学習に使える経験が限られる可能性がある。本論文は、計画を手がかりに動的操作の実演を生成する際の残差補正を学習するDynaForgeを提案する。作業の各段階にわたり、低頻度の大域的計画と、高頻度の物体中心の逆運動学を組み合わせ、動的な相互作用の間は残差方策で行動を補正する。暗黙のカリキュラムは、条件を揃えたロールアウトをまとめ、成功と失敗が混在するグループを選ぶ。これによって残差強化学習を、能力が伸びつつある境界へ集中させる。CanとBottleという作業では、名目上の環境ステップ数を同じにした通常のGRPOに比べて、最適化器の更新回数が0.73倍で、観測された最終成功率は高かった。 九つのシミュレーション作業では、実演生成の平均成功率を計画だけの41.30%から78.37%へ高めた。各作業800件の実演を使うと、DynaForgeのデータで学習したDP3方策の平均成功率は49.11%で、DOMINOのデータを使った場合は7.07%だった。現実世界の三つの動的作業では、DynaForgeで学習した方策の成功率は30~60%、DOMINOで学習した方策は0~10%であり、シミュレーションから実世界への移行が可能であることを示した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Dynamic object manipulation is essential for robots operating in real-world environments, yet methods for generating high-quality demonstrations remain limited. Methods designed for static tasks do not readily transfer to dynamic settings. Among dynamic demonstration generators, planning-based methods can fail near contact, while DOMINO-style replay simplifies dynamic interactions and may limit the experience available for policy learning. We present DynaForge, a planning-guided framework that learns residual corrections for dynamic manipulation demonstration generation. DynaForge combines low-frequency global planning with high-frequency object-centric inverse kinematics across task phases, and applies a residual policy to correct actions during dynamic interaction. An implicit curriculum groups rollouts under matched conditions and selects mixed-success groups, focusing residual reinforcement learning on the evolving competence frontier. On Can and Bottle, it uses 0.73x as many optimizer steps as vanilla GRPO at the same nominal environment-step budget, with higher observed final success rates. Across nine simulation tasks, DynaForge increases mean demonstration-generation success from 41.30% of the planning prior to 78.37%. With 800 demonstrations per task, DP3 policies trained on DynaForge data achieve 49.11% mean success, compared with 7.07% for DOMINO data. On three real-world dynamic tasks, DynaForge-trained policies achieve 30-60% success, compared with 0-10% for DOMINO-trained policies, showing the ability of DynaForge for sim-to-real transfer.
著者のコメント
8 pages, 6 figures. Under review
arXiv ID: 2609.25631 / 要約の誤りについて