arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

ロボットの全体計画と手元の修正を非同期に行うDualWAM

DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement

Yixin Zheng, Jiangran Lyu, Yuntian Deng, Kai Liu, Yizhou Zhou, Yizhou Wang, Xiaoguang Zhao, He Wang, Zhizheng Zhang

この論文をやさしく読む

ひとことで言うと

ロボットの先の見通しを立てる処理と、手元の最新映像を使って動きを直す処理を分け、同時進行させる仕組みです。

何に役立つ?

周囲との接触や動きに応じて素早く修正するロボット操作に役立つと考えられます。実験ではFrankaとGalbotのゼロショット操作で成功率を比較しています。

この研究の面白いところ

全体計画を作り直すたびに待つのではなく、途中のノイズ除去状態を共有し、一つの計画を複数回の局所修正に利用します。

どこまで分かった?

16.6倍はクリティカルパスの高速化であり、タスク全体の完了時間が同じ倍率で短縮したとは述べていません。要旨に残る手法名・系名の未展開マクロは、題名と記述に従いDualWAM、全体計画系、局所修正系として説明しています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

World Action Model(WAM)は、ロボットの行動を生成すると同時に将来の世界状態を予測し、動画での事前学習から得た事前知識をロボット制御へ移す。しかし、将来の視覚状態の予測は計算量が大きいため、既存のWAMは複数の制御ステップに推論コストを分散させるべく、長い行動チャンクに依存しがちであり、その代償として閉ループ制御の応答性が低下する。 本研究では、全体計画と局所修正を分離することで、より長い時間範囲の世界・行動生成を保ちながら、高頻度の閉ループ行動更新を可能にする二系統のWAM、DualWAMを提案する。全体計画を担う系は、より広い範囲の世界・行動チャンクに対して高ノイズ領域の双方向ノイズ除去を周期的に行い、全体計画を定める。一方、手首の観測のみを用いる局所修正系は、ノイズ除去途中の状態から時間的に対応する短い窓を取り出し、最新の手首観測を使って低ノイズ領域の修正を完了する。手首観測は、相互作用中の局所的な形状、動き、接触について、行動と対応した手掛かりを与える。 二つの系は共通のノイズ除去軌道に沿って非同期に動作する。一つの全体計画が複数の局所更新に再利用される一方、局所修正系は新しい相互作用のフィードバックを繰り返し取り込む。FrankaとGalbotでのゼロショット操作タスク全体で、DualWAMは評価対象の最も強いベースラインに対して成功率を平均4.5パーセントポイント改善し、クリティカルパスを16.6倍高速化した。追加の検討では、役割に合った一人称視点データとUMIデータが成功率を14パーセントポイント改善すること、また、この分離設計がエッジ・クラウド構成を自然に支え、ベースラインより通信負荷を大幅に下げられることを示した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

World Action Models (WAMs) jointly generate robot actions and predict future world states, transferring priors from video pretraining to robot control. However, future visual prediction is computationally expensive, so existing WAMs often rely on long action chunks to amortize inference cost across control steps, at the cost of closed-loop responsiveness. We present \method, a dual-system WAM that preserves broader-horizon world-action generation while enabling high-frequency closed-loop action updates by decoupling global planning and local refinement. \systwo periodically performs high-noise bidirectional denoising over a broader world-action chunk to establish a global plan, while wrist-only \sysone extracts a temporally aligned short window from the intermediate denoising state and completes low-noise refinement using the latest wrist observations, which provide action-aligned cues about local geometry, motion, and contact during interaction. The two systems operate asynchronously along a shared denoising trajectory: each global plan is reused across multiple local updates, while \sysone repeatedly incorporates fresh interaction feedback. Across zero-shot manipulation tasks on Franka and Galbot, \method improves success over the strongest evaluated baseline by 4.5 percentage points on average, while achieving a 16.6$\times$ critical-path speedup. Further studies show that role-matched egocentric and UMI data improve success by 14 percentage points, and that the decoupled design naturally supports edge--cloud deployment with substantially lower communication overhead than the baseline.

著者のコメント

Project page: https://steveouo.github.io/DualWAM-Web/

arXiv ID: 2609.24868 / 要約の誤りについて