arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

コーディングエージェントの解をロボット方策の学習に使う

EmbodiedSWE: Coding Agents for Long Horizon Dexterous Robotics

Haoxiang You, Zeyu Shen, Yilang Liu, Zhicheng Zheng, Lihan Zha, Kashu Yamazaki, Mingtong Zhang, Suning Huang, Jiankai Sun, Qianzhong Chen, Lucy He, Kaiyuan Liu, Haoran Chang, Katerina Fragkiadaki, Dhruv Shah, Mac Schwager, Peter Henderson, Ian Abraham, Canwen Xu

この論文をやさしく読む

ひとことで言うと

コーディングエージェントにロボット操作を解かせ、その解を多様な実演へ増やしてロボット方策を学習させる研究。

何に役立つ?

考えられる用途は、複雑な操作タスクの学習用データを作ること。実ロボットでも一つの長時間タスクの完了が報告された。

この研究の面白いところ

一つの解は個別事例に偏るため、解を多数の異なる軌跡に展開してVLAを学習させる。

どこまで分かった?

コーディングエージェントの解には多くの反復が必要で、通常は個別タスクに特化する。実ロボットでの報告は要旨では一つの長時間タスクである。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

長い時間にわたる器用なロボット操作にコーディングエージェントを用い、その解が汎用ロボット方策の学習に拡張可能な教師信号になるかを調べる。この検証のため、接触の多い操作、変形可能な物体、最大30分の連続的なやり取りを要する長時間タスクを含む、コーディングエージェント向けシミュレーション基準EMBODIEDSWE-BENCHを開発した。最先端のコーディングエージェントは複雑な長時間タスクを解き、過去の解をタスク間およびロボットの身体構成間で移せることが分かった。これらのタスクをより効果的に解くための支援ツールも設計した。ただし得られた解には多くの反復的なやり取りが必要で、通常は個々のタスク事例に特化する。そこで、コーディングエージェントの一つの解から、視覚・言語・行動モデル(VLA)の学習に使える多様で大量の軌跡を作るEMBODIEDSWE-GENを導入する。生成された実演が増えるほどVLAの性能は向上し、エージェントを使った多様化は、学習時に見ていないタスクの変種への汎化を改善した。また、コーディングエージェントが生成したシミュレーション上の実演だけで微調整したVLAが、実ロボットで長時間タスクを完了することも示した。この枠組みは、コーディングエージェントで複雑なロボットタスクを解き、検証済みの解をロボット方策の拡張可能な教師信号に変える。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study coding agents for long-horizon, dexterous robotics and ask whether their solutions can provide scalable supervision for learning general robot policies. To test this, we develop EMBODIEDSWE-BENCH, a simulation benchmark for coding agents spanning contact-rich manipulation, deformable objects, and long-horizon tasks requiring up to half an hour of continuous interaction. We find that frontier coding agents can solve complex long-horizon tasks and transfer prior solutions across both tasks and embodiments. We also design supporting tools that help agents more effectively solve these tasks. However, the resulting solutions require substantial iterative interaction and are typically specialized to individual task instances. We therefore introduce EMBODIEDSWE-GEN, which expands a single solution from coding agent into large diverse trajectories for training a VLA. VLA performance improves with more generated demonstrations, and agent-aided diversification improves generalization to held-out task variations. We also show that a VLA finetuned solely on coding-agent-generated simulation demonstrations completes a long-horizon task on real robot. Together, our framework uses coding agents to solve complex robotics tasks and turn verified solutions into scalable supervision for robot policies.

arXiv ID: 2609.27308 / 要約の誤りについて