arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

写真と指示からロボット操作の学習データを作る

ARSTAG: An Agentic Real2Sim2Real System for Task-Specific Robot Data Generation

Bowei Li, Yuner Zhang, Changliu Liu

この論文をやさしく読む

ひとことで言うと

写真1枚と作業の指示から仮想環境を作り、ロボットの練習用データまで生成する仕組みです。そのデータで学習した方策を実物の双腕ロボットに移しています。

何に役立つ?

新しい物体操作のたびに行う環境設定や遠隔操作による実演収集を減らす用途が考えられます。実証されたのは把持・配置・積み重ねを含む7タスクで、pi0.5の平均成功率は74.6%でした。

この研究の面白いところ

複数の言語エージェントが場面作成から実演生成までを分担し、調整役が工程をまたぐ失敗に対応します。見た目を無作為に変えるだけでなく、タスクが成立する範囲で学習条件を広げる点が特徴です。

どこまで分かった?

74.6%は評価した7タスクでのpi0.5の平均値であり、すべての方策や未知の作業に共通する成功率ではありません。要旨にはタスク別の成績や生成に必要な時間は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚運動方策を新しい操作タスクに適応させるには、多くの場合、多大な手作業による設計や遠隔操作でのデータ収集が必要になる。シミュレーションを使えばタスクに特化したデータを大規模に用意できるが、場面の構築、熟練動作の設計、データ生成の設定には、なおタスクごとの相当な労力を要する。 本研究では、1枚のRGB画像と自然言語の指示を、ロボットの方策学習用データへ直接変換する、エージェント型のReal2Sim2RealシステムARSTAGを提案する。階層化した言語エージェント群が、タスクに必要な範囲のシミュレーション場面を構築し、ロボットが実行可能な実演を生成し、タスクとの整合性を保ったランダム化によって学習分布を広げる。その間、調整役のエージェントが工程間のフィードバックと失敗からの復旧を管理する。 把持、配置、積み重ねにわたる7つの操作タスクで、ARSTAGが生成した実演により、3種類の視覚運動方策アーキテクチャをシミュレーションから双腕ロボットへ転移できた。pi0.5は実環境で平均74.6%の成功率を達成した。アブレーション実験では、タスクと整合したランダム化が頑健性を大きく改善し、生成データセットの規模が大きくなるほど方策の性能が向上した。プロジェクトのウェブページは https://boweili666.github.io/ARSTAG/ 。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Adapting visuomotor policies to new manipulation tasks often requires substantial manual engineering or teleoperated data collection. Simulation can provide task-specific data at scale, but constructing the scene, designing expert behavior, and configuring data generation still require significant per-task effort. We present ARSTAG, an agentic Real2Sim2Real system that turns a single RGB image and a natural-language instruction directly into robot policy-learning data. A hierarchy of language agents constructs a task-scoped simulation scene, generates robot-feasible demonstrations, and expands the training distribution through task-consistent randomization, while a coordinator agent manages cross-stage feedback and recovery. Across seven manipulation tasks spanning grasping, placement, and stacking, the ARSTAG-generated demonstrations enable sim-to-real transfer of three visuomotor policy architectures to a dual-arm robot, with pi0.5 achieving an average real-world success rate of 74.6%. Ablations show that task-consistent randomization substantially improves robustness, and policy performance increases with generated dataset size. Project webpage: https://boweili666.github.io/ARSTAG/.

著者のコメント

12 pages, 15 figures and tables. Project webpage: https://boweili666.github.io/ARSTAG/

arXiv ID: 2609.24563 / 要約の誤りについて