場面全体を保ちながらロボット操作へ領域マスクを使う
RoboMP-DINOv2: Prompts, Not Filters for Robust Robot Manipulation
この論文をやさしく読む
ひとことで言うと
物体のマスクを指示として使い、場面全体の情報を残してロボットの行動を予測する。
何に役立つ?
見た目や位置が変わる場面でのロボット操作モデルの設計に役立つ可能性がある。
この研究の面白いところ
マスク外を捨てずに全画面の特徴を使い、領域の色のランダム化も加える。
どこまで分かった?
七つのシミュレーション条件での成功率であり、実機での成功率は要旨に示されない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ロボットの操作方針は、行動に必要な場面の文脈を保ちながら、見た目の変化へ一般化する必要がある。汎用の視覚エンコーダーは視覚と運動を結ぶ制御に合わせて作られておらず、物体中心の方法では領域分割マスクを厳密なフィルターとして使い、有用な周辺情報まで捨てることが多い。著者らは、マスクを可視範囲のフィルターではなく空間的な指示として扱い、場面全体を使う視覚エンコーダーRoboMP-DINOv2を提案する。観測画像全体から密なDINOv2特徴を取り出し、マスクされた位置に学習した領域固有の埋め込みを加え、指示のあるトークンとないトークンの文脈を合わせて行動を予測する。見た目の変化への頑健性を高めるため、マスク領域の色をランダム化するMCRも導入した。七つのシミュレーション操作条件では、空間位置が変わった場合の成功率は60.7%、場面に物が多い場合は59.7%で、DINOv2を使うDiffusion Policyの50.7%、41.0%をそれぞれ上回った。未見の物体色ではMCR版が72.5%の成功率を示し、最も強い色ランダム化の比較手法の35.1%を上回った。追加実験と表現解析からも、行動に必要な場面情報を保ちながら頑健性が改善することが示された。コードは著者らのGitHubで公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Robot manipulation policies must generalize across visual shifts while preserving scene context relevant to action. General-purpose vision encoders are not tailored to visuomotor control, while object-centric approaches often use segmentation masks as hard filters that discard potentially useful context. We propose RoboMP-DINOv2 (Robotics Mask-Prompted DINOv2), a full-scene vision encoder that treats masks as spatial prompts rather than visibility filters. It extracts dense DINOv2 features from the full observation, injects learned region-specific embeddings at masked locations, and jointly contextualizes prompted and unprompted tokens for action prediction. We further introduce masked-region color randomization (MCR) to improve appearance robustness, yielding RoboMP-DINOv2-MCR. Across seven simulated manipulation settings, RoboMP-DINOv2 achieves 60.7% success under spatial shifts and 59.7% under scene clutter, compared with 50.7% and 41.0% for a DINOv2-based Diffusion Policy. Under unseen object colors, RoboMP-DINOv2-MCR achieves 72.5% success versus 35.1% for the strongest color-randomized baseline. Additional experiments and representation analyses show improved robustness while preserving behaviorally relevant scene information. Code is available at https://github.com/han20192019/RoboMP_DINOv2.
arXiv ID: 2609.25506 / 要約の誤りについて