1枚の画像から器用なロボット操作の学習環境を作る
DEXTERA: From a Single Image to Deployable Dexterous Manipulation via Real-to-Sim-to-Real
この論文をやさしく読む
ひとことで言うと
写真1枚から操作対象の形や物理特性を推定し、仮想環境でロボットを学習させて実機へ移す仕組みです。環境作成から方策学習までをつないでいます。
何に役立つ?
考えられる用途は、ロボット操作の学習環境を手作業で作る負担の軽減です。実データとの併用も扱うため、シミュレーションを実機学習の補助として使う設計の参考になります。
この研究の面白いところ
見た目を似せるだけでなく、実寸の位置合わせ、関節付き物体、ロボットの形態差、操作軌道まで一連の処理に含めています。複数の学習方式で共通の環境を評価しています。
どこまで分かった?
成功率61.9%はシミュレーションと実データを併用した結果で、写真1枚とシミュレーションのみで達成した値ではありません。評価範囲は13通りのタスク・身体構成の組み合わせなどに限られ、あらゆる場面での成功は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
器用なロボット操作のために実世界のデータを集めるには、多くの費用と時間がかかる。高忠実度の物理シミュレーターは、大規模なデータ合成と方策学習を可能にする一方、実機展開に使えるデジタルツインを手作業で構築することは依然として労力を要し、残存する見た目・幾何形状・動力学の差が、シミュレーションから実機への確実な移行を妨げている。本研究では、1枚のRGB画像を、実機展開可能な器用な操作方策へ変換する自動の実世界・シミュレーション・実世界間フレームワークDEXTERAを提案する。 DEXTERAは四つの段階を統合する。(1)単一画像の場面を、静的なガウス表現の背景と、視覚言語モデルで物理パラメータを推定した、相互作用可能な剛体または関節付き物体に分解する。(2)実寸尺度でのシーン全体の位置合わせ、物体の標準座標化、ロボットの形態間のバランスを考慮した較正を行う。(3)シミュレーターの基本タスク構築、VR遠隔操作、物体中心の軌道合成を大規模に実行する。(4)模倣学習と強化学習の両方に対応する、共通のマルチモーダル方策インターフェースを用いる。 13通りのタスクと身体構成の組み合わせ、2種類の器用な操作用ロボットプラットフォーム、6種類の方策アーキテクチャでDEXTERAを評価した。実験では、生成型ベースラインよりも高い視覚的忠実度と3次元幾何再構成性能が得られ、異なる領域間での軌道再生により、物理的相互作用の高い整合性が確認された。さらに、シミュレーションだけで学習した方策でも実ロボットへのゼロショット展開が可能であり、シミュレーションと実データを併用した学習では、多様な方策アーキテクチャにわたる実機での平均成功率が29.2%から61.9%へ大幅に向上した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Collecting real-world robot data for dexterous manipulation is costly and time-consuming. While high-fidelity physics simulators enable scalable data synthesis and policy learning, constructing deployment-ready digital twins manually remains labor-intensive, and residual visual, geometric, and dynamics gaps hinder reliable sim-to-real transfer. We present DEXTERA, an automated real-to-sim-to-real framework that transforms a single RGB image into deployable policies for dexterous manipulation across four unified stages: (1) single-image scene factorization into a static Gaussian background and interactive rigid or articulated assets with VLM-inferred physical parameters; (2) metric scene global alignment, object canonicalization, and morphology-balanced robot calibration; (3) scalable simulator task primitive construction, VR teleoperation, and object-centric trajectory synthesis; and (4) a shared multimodal policy interface supporting both imitation learning and reinforcement learning. We evaluate DEXTERA across 13 task-embodiment pairs, 2 dexterous robot platforms, and 6 policy architectures. Experimental results demonstrate that DEXTERA achieves superior visual fidelity and 3D geometric reconstruction compared to generative baselines, while cross-domain trajectory replays validate strong physical interaction consistency. Furthermore, simulation-only trained policies enable viable zero-shot real-robot deployment, while simulation-real co-training substantially improves mean physical policy success from 29.2% to 61.9% across diverse policy architectures.
arXiv ID: 2609.21045 / 要約の誤りについて