arXiv論文メモ
新着一覧
cs.RO / cs.AI · 査読状況未確認

実行で改良したロボット制御コードを新しい課題へ転用する

Learning and Transferring Closed-Loop Robot Software

So Kuroki, Yujin Tang

この論文をやさしく読む

ひとことで言うと

シミュレーションで改善したロボット制御コードを蓄積し、新しい作業の制御をつくる際の参考として再利用する方法です。

何に役立つ?

観測処理や状態管理、条件分岐を含む制御ソフトの開発を支援する用途があります。生成・改善後のコードは固定され、実行中には追加のモデル呼び出しを必要としません。

この研究の面白いところ

九つの新規課題では、参照なしの平均成功率45.2%、初期コード参照41.5%に対し、改善済みコード参照は57.0%でした。単にコードを渡すことより、実行結果で磨いたコードを残すことが有効でした。

どこまで分かった?

RoboCasaでのシミュレーション評価です。三回の試行平均で、九課題中二課題は初期コード参照の方が良く、すべての作業で改善済みコードが優れるわけではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

閉ループのロボット方策には、観測の処理、状態の管理、状況に応じた分岐が必要であり、人手で設計・調整するには大きなコストがかかる。コーディングエージェントによる制御コードの生成や最適化への支援は広がっているが、元の課題で改良した実装が、新しい課題の方策獲得にも役立つかは明らかでない。本研究では、閉ループ制御の実装全体を再利用可能な実行経験として扱い、この問題を調べる。 各元課題について、コーディングエージェントが少数の成功実演から方策コードを生成し、シミュレーションのフィードバックを用いて反復的に改良する。検証により選んだ実装をソフトウェアのアーカイブに保存する。新しい課題では、保存した実装、対象課題の実演、実行フィードバックを用いて方策を生成・改良する。完成した方策は固定され、その後はモデルを追加で呼び出さずに実行される。 RoboCasaの4つの元課題では、反復最適化により平均成功率が28.3%から64.2%へ上昇した。9つの対象課題に対する独立した3回の実行では、平均成功率は参照なしで45.2%、初期の元コードを参照すると41.5%、最適化した元コードを参照すると57.0%だった。9課題の平均では、3回すべてで最適化済み参照が初期参照を上回り、平均改善幅は15.6パーセントポイントだった。これらの結果は、この設定において、実行を通じて改良したソフトウェアが新しい方策を獲得する資源として有用であることを示す。ただし、実行間の平均では、2つの対象課題で初期参照の方が優れていた。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Closed-loop robot policies require observation processing, state management, and situation-dependent branching, making them costly to design and tune manually. Although coding agents increasingly support control-code generation and optimization, it remains unclear whether implementations improved on source tasks also support policy acquisition for new tasks. We study this question by treating complete closed-loop implementations as reusable execution experience. For each source task, a coding agent generates policy code from a few successful demonstrations and iteratively improves it using simulation feedback. The validation-selected implementations are retained in a software archive. For new tasks, the agent generates and improves policies using archived implementations, target demonstrations, and execution feedback. The resulting policy is then frozen and executes without further model calls. Across four source tasks in RoboCasa, iterative optimization increases mean success from 28.3% to 64.2%. Across nine target tasks and three independent runs, mean success is 45.2% without references, 41.5% with initial source code, and 57.0% with optimized source code. Optimized references outperform initial references in all three runs on the nine-task average, with a mean gain of 15.6 percentage points. These results demonstrate the value of execution-improved software as a resource for acquiring new policies in this setting, although initial references remain better on two target tasks when averaged across runs.

arXiv ID: 2609.19906 / 要約の誤りについて