未来の画像とトルクの予測を使ってロボットの行動を評価
Imagine-RL: Residual-Confidence-Guided Cross-Attention for World-Model-Augmented VLA Reinforcement Learning
この論文をやさしく読む
ひとことで言うと
ロボットの行動候補を、今の画像だけでなく、その行動の後の見え方やトルクの予測も使って選ぶ方法です。
何に役立つ?
考えられる用途は、物に接触しながら操作するロボットの追加学習です。四つの実機課題で成功率の改善を報告しています。
この研究の面白いところ
未来予測を常に信用せず、直前の予測誤差を使って信頼しにくい部分の重みを下げます。基礎となるVLAと世界モデルは更新しません。
どこまで分かった?
23.6%と60%は要旨の表記どおりで、相対改善率かパーセントポイント差かは明示されていません。100軌跡の課題間の配分も要旨にはありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
接触が多い操作で行動を信頼性高く評価するには、現在の観測だけでなく、将来の視覚的な結果と接触の結果を見る必要がある。既存のノイズ空間強化学習は、固定した視覚・言語・行動(VLA)方策を効率的に誘導するが、その評価器はこれらの結果をほぼ考慮していない。本研究では、ノイズ空間でのVLAの事後学習を、行動に条件付けた画像・トルクの想像で拡張するImagine-RLを提示する。候補となる各行動チャンクについて、固定した視覚・トルク潜在世界モデル(VTLWM)が、画素を再構成せず、簡潔な未来表現を自己回帰的に予測する。 現在の画像・状態・行動のクエリが、観測履歴と予測された未来へ注意を向ける一方、前の時間窓の予測残差はトークンごとの信頼度の事前情報を与え、信頼できない未来トークンを抑制する。現在の証拠と予測結果を組み合わせることで、行動評価器は候補行動をよりよく評価して行動生成器を指導し、その間VLAとVTLWMは固定したままである。タスクごとに50回の評価試行を行う四つの実ロボット課題で、Imagine-RLはわずか100本の強化学習軌跡を使い、平均成功率をDSRLに対して23.6%、VLAベースラインに対して60%改善した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Reliable action evaluation in contact-rich manipulation requires looking beyond the current observation to future visual and contact consequences. Existing noise-space reinforcement learning efficiently steers a frozen Vision-Language-Action (VLA) policy, but its critics largely ignore these consequences. We present Imagine-RL, which augments noise-space VLA post-training with action-conditioned visual-torque imagination. For each candidate action chunk, a frozen visual-torque latent world model (VTLWM) autoregressively predicts compact future representations without pixel reconstruction. A current image-state-action query attends to observed histories and predicted futures, while previous-window prediction residuals provide token-wise confidence priors that suppress unreliable future tokens. By combining current evidence with predicted consequences, the action critic better evaluates candidate actions and supervises the actor, while the VLA and VTLWM remain frozen. Across four real-robot tasks with 50 evaluation trials per task, Imagine-RL uses only 100 RL trajectories and improves the average success rate by (23.6%) over DSRL and by (60%) over VLA baselines.
著者のコメント
8 pages, 9 figures
arXiv ID: 2609.24033 / 要約の誤りについて