arXiv論文メモ
新着一覧
cs.RO / cs.AI / cs.CV · 査読状況未確認

ロボット動作の予測計算を時間方向に分散するRolling-WAM

Rolling-WAM: World Action Models with Rolling Imagination

Yinghua Zhou, Junjie Ye, Yiqi Zhao, Hao Dong, Celina Shiyu Wang, Ruohai Ge, Tingyi Yang, Basile Van Hoorick, Gaurav Sukhatme, Vitor Guizilini, Yue Wang

この論文をやさしく読む

ひとことで言うと

ロボットが次の動作を決める際の映像・行動予測を、複数の再計画周期に分けて進める方法。

何に役立つ?

考えられる用途は、カメラ情報に合わせて素早く動作を更新するロボット操作。要旨で実証されたのは、指定されたベンチマークと実機での操作性能、および再計画速度の改善。

この研究の面白いところ

直近の動作だけを実行可能な状態まで仕上げ、先の動作は途中まで計算して次の周期へ引き継ぐ。標準的な同時WAMに対して定常状態の再計画が4.5倍速い。

どこまで分かった?

評価対象としてLIBERO、RoboTwin、Unitree G1が挙げられる。要旨には、他のロボットや作業への一般化、絶対遅延、個別成功率の数値は示されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

世界行動モデル(WAM)は、ロボットの物体操作のために、行動生成と将来の視覚情報の予測を組み合わせる。しかし、計画を立て直すたびに映像と行動の同時ノイズ除去を最後まで行うと待ち時間が大きくなり、行動の更新が遅れて閉ループ制御の応答性が制限される。本研究は、同時ノイズ除去を連続する再計画サイクルに分散する定式化Rolling-WAMを提示する。この方法は、ノイズの程度をずらした映像・行動の断片をスライド窓内に保持する。各段階では、順送りのノイズスケジュールにより、すぐ実行する行動の断片を完全にノイズ除去する一方、より先の断片は部分的に洗練する。新しいカメラ観測によって窓が進むと、保持された将来の断片はノイズ除去を続ける。この仕組みにより計算費用を時間方向に分散し、断片の境界を越えて更新される視覚・行動の文脈を維持する。LIBERO、RoboTwin、および実機のUnitree G1ヒューマノイドによる評価では、Rolling-WAMは競争力のある物体操作性能を示した。予測期間全体を毎回最初からノイズ除去する必要をなくし、標準的な同時WAMと比べて定常状態の再計画速度を4.5倍にした。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

World Action Models (WAMs) couple action generation with future visual prediction for robotic manipulation. However, completing the joint video-action denoising process at each replanning cycle incurs substantial latency, delaying action updates and limiting closed-loop responsiveness. We present Rolling-WAM, a formulation that distributes joint denoising across successive replanning cycles. Our method maintains a sliding window of video-action chunks at staggered noise levels. At each step, a rolling noise schedule fully denoises the imminent action chunk for execution, while partially refining farther-future chunks. As the window advances with new camera observations, the retained future chunks continue their denoising process. This distributes the computational cost over time while carrying an evolving visual-action context across chunk boundaries. Evaluations on LIBERO, RoboTwin, and a real-world Unitree G1 humanoid show that Rolling-WAM achieves competitive manipulation performance. By removing the need to denoise the entire prediction horizon from scratch, it delivers a 4.5x steady-state replanning speedup over standard joint WAMs.

著者のコメント

10 pages, 7 figures, 5 tables. Under review. Project page: https://rolling-wam.github.io/

arXiv ID: 2609.30247 / 要約の誤りについて