見続けるか視点を変えるかを操作と同時に学ぶロボット
ActiveWAM: Evidence-Aware Active Vision for World-Action Models
この論文をやさしく読む
ひとことで言うと
ロボットが手をどう動かすかと同時に、カメラを動かすか、今の手掛かりを見続けるかを学ぶ方法です。
何に役立つ?
視点を変えると必要な物が見えなくなるような両腕操作で、観測と動作を協調させる仕組みになります。要旨には実環境の台所タスクでの評価もあります。
この研究の面白いところ
未来の動画予測は学習を助けるために使い、動作時には動画を生成する処理を省いています。視点を動かさない判断も明示的に扱います。
どこまで分かった?
17.0ポイントはTAVIS分布外評価での最大改善で、20.0と26.7ポイントは別の評価でFast-WAMと比較した値です。これらを同一条件の効果として足し合わせることはできません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
能動視覚を用いる物体操作では、方策がカメラとエンドエフェクタの両方を制御する必要がある。しかしカメラの動きによって、限られた観測期間にどの根拠情報が見え続けるかが決まる。新しい視点を得るとタスクに不可欠な手掛かりが視野から外れる可能性があり、現在の視点を維持すると有用かもしれない観測を得る機会を失う。本研究ではこれを、根拠情報を考慮した「維持か取得か」の問題として定式化し、観測と操作を同時に学習する統合世界・行動モデルActiveWAMを提案する。 このため、タスク情報を持つ元の観測と目に見える時間変化によって、凍結した動画の事前モデルを制約する、学習時の逆推定を提案する。これにより、テスト時の逆推定や候補の順位付けは不要になる。配備時には、視点を考慮した履歴から、視点の維持や再取得を含む両腕動作とパン・チルト動作を生成し、新たに実測したRGB観測から文脈を更新する。未来動画の予測を共同学習の信号として使う一方、行動生成には未来動画の復号も最適視点の注釈も必要ない。実行可能なパン・チルト制御と自動生成した実演を備える、50タスクのベンチマークRoboTwin-AVを導入する。ActiveWAMは、TAVISの分布外成功率を最も強い比較手法より最大17.0パーセントポイント改善し、RoboTwin-AVではFast-WAMより20.0ポイント、実環境の物理的な台所タスクでは26.7ポイント上回る。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Active vision manipulation requires a policy to control both its camera and its end-effectors, yet camera motion determines which evidence remains visible within finite observation windows. Acquiring a new view can displace task-critical cues, while retaining a view forgoes potentially useful observations. We formulate this as an evidence-aware retain--acquire problem and present ActiveWAM, a unified world--action model that learns observation and manipulation jointly. To this end, we propose training-time inversion which constrains a frozen video prior by task-bearing source evidence and visible temporal changes, eliminating the need for test-time inversion or candidate ranking. At deployment, the policy generates bimanual and pan/tilt actions-including stay and reacquisition behaviors-from view-aware history, and updates context from newly measured RGB observations. Future-video prediction serves as a co-training signal, while action generation requires neither future-video decoding nor optimal viewpoint annotations. We introduce RoboTwin-AV, a 50-task benchmark with executable pan/tilt control and automatically generated demonstrations. ActiveWAM improves TAVIS out-of-distribution success by up to 17.0 percentage points over the strongest baselines, achieves 20.0 additional points over Fast-WAM on RoboTwin-AV, and outperforms it by 26.7 points on real-world physical kitchen tasks.
arXiv ID: 2610.01698 / 要約の誤りについて