見えなくなった場所を覚えてロボットの操作に生かす
LIFD: Anchored Diffusion for 3D-Aware Scene Memory in Robotic Manipulation
この論文をやさしく読む
ひとことで言うと
ロボットが以前見た場所を記憶し、今見える情報と照らし合わせて、視野外を含む作業場面を補いながら操作する仕組みです。
何に役立つ?
カメラから一時的に物体や場所が見えなくなる操作で、観測履歴を制御に生かす用途が考えられます。運用時はRGBカメラ1台に加えて自己受容感覚情報と指示を使います。
この研究の面白いところ
過去の記憶から自由に補うだけでなく、現在観測できる幾何情報に生成をつなぎ止めています。学習時の複数視点情報と、運用時の入力条件を分けている点も特徴です。
どこまで分かった?
LIBERO・MetaWorldのベンチマーク値と、実機UR5eの4課題系列での56%は別の評価です。実機評価では系列ごとに10回の実演による適応を行っています。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ロボットによる物体操作では、ロボットや場面の動きにより、以前観測した領域がカメラの視野外へ移ることがある。幾何を考慮したRGB特徴は見えている構造を符号化するが、部分的にしか観測できない状況での制御には、観測履歴を統合し、推測した内容を現在の証拠に根付かせる場面記憶が必要となる。本研究では、持続的で3次元構造を考慮する場面記憶の枠組みLIFD(Look, Imagine, Focus, and Do)を導入する。 LIFDは複数視点間の一致を通じて場面トークンを学習し、その後、単一のRGB視点と反復的な記憶から、rectified flowを用いてトークンを補完する。アンカー誘導型クロスアテンションにより、生成を現在の幾何を考慮した特徴に結び付け、コンパクトなスロット特徴を視覚運動方策の条件として与える。表現学習では複数視点と幾何の教師情報を用いるが、運用時に必要なのはRGBカメラ1台、自己受容感覚情報、課題指示である。 段階的に学習するLIFD(Staged)は、LIBEROで平均成功率91.6%、MetaWorldで79.8%に達し、LIBEROの平均成功率を同時学習に比べて11.1パーセントポイント改善した。課題系列ごとに10回の実演で方策ヘッドを適応させた後、UR5eの4つの課題系列全体で平均成功率56.0%を達成した。比較対象のOpenVLA-7Bは40.5%だった。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-18 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
During manipulation, robot and scene motion can move previously observed regions outside the camera's field of view. Geometry-aware RGB features encode visible structure, while control under partial observability requires scene memory that integrates observation history and grounds inferred content in current evidence. We introduce \lifd{} (Look, Imagine, Focus, and Do), a framework for persistent, 3D-aware scene memory. LIFD learns scene tokens through multi-view agreement, then completes them from a single RGB view and recurrent memory using rectified flow. Anchor-Guided Cross-Attention anchors generation to current geometry-aware features, and compact slot features condition a visuomotor policy. Multi-view and geometric supervision are used during representation learning; deployment requires one RGB camera, proprioception, and a task instruction. LIFD (Staged) reaches 91.6\% average success on LIBERO and 79.8\% on MetaWorld, improving LIBERO average success by 11.1 percentage points over Joint training. After policy-head adaptation with ten demonstrations per family, LIFD achieves 56.0\% mean success across four UR5e task families, compared with 40.5\% for OpenVLA-7B.
著者のコメント
8 pages, 4 figures. Submitted to ICRA 2027
arXiv ID: 2609.19796 / 要約の誤りについて