ロボットの局所的な再試行でAI呼び出しを減らす
Fewer Tokens, Better Action: GPT-6 Astra Robot Agents with 14% Higher Success Rate but 65% Fewer Tokens
この論文をやさしく読む
ひとことで言うと
ロボットの細かい確認ややり直しをコード側で行い、AIには必要な観測だけを返すことで、呼び出し回数と入力を減らします。
何に役立つ?
考えられる用途は、画像を見て行動するロボットエージェントの推論負担を減らすことです。ここでの成功率改善は700件のシミュレーション課題で確認されたものです。
この研究の面白いところ
計画用モデルと基本動作を共通にして、動作の組み合わせ方と観測の返し方を比較しています。単に観測を減らすだけでなく、局所的な再試行をコードへ任せる設計です。
どこまで分かった?
成功率の差は8.6ポイントです。呼び出し49%減と入力トークン65%減は両手法が成功した課題に限定した比較で、全700件の平均とは区別が必要です。実機での結果は要旨にはありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚言語モデル(VLM)エージェントは、視覚的なフィードバックと基本動作を通じてロボットを制御できるが、モデルを繰り返し呼び出したり、冗長な観測を行ったりすると、大きなトークン負担が生じる。本研究では、フィードバックに基づく基本動作の組み合わせと、選択的な観測を結び付ける対話型コード実行の枠組みPyRUA-Leanを導入する。エージェントは、従来型のロボット基本動作と学習済み視覚・言語・行動(VLA)方策を、条件確認と局所的な再試行を行うPythonセルへ組み合わせる。そして、再計画に必要な、明示的に要求された画像と状態フィードバックだけを返す。 LIBERO-PRO、RoboTwin 2.0、RoboCasa365からの700件のシミュレーション課題で、同じGPT-6 Astraの計画器と基礎となるロボット基本動作を使うツール呼び出し型の比較手法と、PyRUA-Leanを比較した。LLM呼び出し回数の予算を等しくした条件では、PyRUA-Leanは全体の成功率を63.1%から71.7%へ高めた。両方のエージェントが解けた課題では、LLM呼び出し回数が49%、入力トークン数が65%少なかった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Vision language model (VLM) agents can control robots through visual feedback and action primitives, but repeated model invocations and redundant observations incur substantial token overhead. We introduce PyRUA-Lean, an interactive code-execution framework that couples feedback-driven primitive composition with selective observation: the agent composes classical robot primitives and learned vision-language-action (VLA) policies into Python cells that perform conditional checks and local retries, returning only explicitly requested images and state feedback for replanning. Across 700 simulated task instances from LIBERO-PRO, RoboTwin 2.0, and RoboCasa365, we compare PyRUA-Lean with a tool-calling baseline using the same GPT-6 Astra planner and underlying robot primitives. Under equal LLM-call budgets, PyRUA-Lean increases overall success from 63.1% to 71.7%. On instances solved by both agents, it uses 49% fewer LLM calls and 65% fewer input tokens.
arXiv ID: 2610.01939 / 要約の誤りについて