arXiv論文メモ
新着一覧
cs.RO / cs.AI / cs.LG · 査読状況未確認

ロボットの未来予測をタスク完了へ導く生成方法

Completion Aware Guidance for World Action Models

Seungyeon Kim, Junhoo Lee, Baekseung Kim, Minkyu Kim, Nojun Kwak

この論文をやさしく読む

ひとことで言うと

ロボットがもっともらしい次の動きを予測し続けても目的を達成しない問題に、生成時の誘導で対処する方法です。

何に役立つ?

世界行動モデルを使うロボット制御で、追加学習なしにタスク完了率を改善する手段として検討できます。

この研究の面白いところ

原因を基盤モデルの能力だけに求めず、短い区間で制御する使い方に着目しています。局所的な自然さとタスク完了を分けて扱う点が特徴です。

どこまで分かった?

RoboTwin 2.0の一部とゼロショットシミュレーションでの結果です。成功率は改善後も70%と75%で、実機での一般的な成功を保証する結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

世界行動モデル(WAM)は、将来の視覚情報とロボットの行動を予測する。しかし、もっともらしく行動とも整合する予測であっても、タスク完了に必要な遷移が抜け落ちる「タスク未完了の想像」に陥りやすい。本稿では、この失敗が世界モデルの基盤そのものに内在するのではなく、短い行動のまとまりによる制御へ適応した際に生じることを示す。そのような制御は、タスクを完了させる遷移よりも、局所的にもっともらしい続きを繰り返し優先しうる。 この問題に対し、生成をタスク完了へ誘導する、学習不要のサンプリング方法Completion Aware Guidance(CAG)を提案する。代表的なWAMを対象に、CAGはRoboTwin 2.0の部分集合で成功率を64%から70%へ、ゼロショットのシミュレーションで69%から75%へ改善した。同時に、タスク未完了の想像を79%から40%へ減らした。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

World Action Models (WAMs) predict visual futures and robot actions, yet they remain susceptible to task-incomplete imagination, where plausible, action-consistent predictions omit the transition needed for task completion. In this paper, we show that this failure is not inherent to the world model backbone, but emerges when adapted for short-chunk control, which can repeatedly favor plausible local continuations over task-completing transitions. To address this, we introduce Completion Aware Guidance (CAG), a training-free sampling method that guides generation toward task completion. Across representative WAMs, CAG improves success from 64% to 70% on a RoboTwin 2.0 subset and from 69% to 75% in zero-shot simulation, while reducing task-incomplete imagination from 79% to 40%.

arXiv ID: 2610.01559 / 要約の誤りについて