arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

似た物を見分けて操作するロボットの物体記憶

Towards Fine-Grained Object Manipulation: SAM3-Guided Visuomotor Policy with Persistent Memory Learning and Focused Visual Conditioning

Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

この論文をやさしく読む

ひとことで言うと

同じ種類のよく似た物の中から、指定された一つを覚えて選び、ロボットが操作する研究です。見た目を覚える部分と、選んだ物に集中して動く部分を組み合わせます。

何に役立つ?

似た部品や日用品を個体単位で扱うロボットへの応用が考えられます。実物30個のデータセットと三つの実ロボット課題で評価されており、単なる画像上の識別だけにとどまりません。

この研究の面白いところ

大きな視覚モデルSAM3本体を変更せず、再利用可能な記憶トークンを少数の登録画像から学びます。対象の内部の見た目と位置の座標を両方使って行動を条件付けしています。

どこまで分かった?

要旨に示される評価は四分類30個の物体と三つの実機課題です。成功率などの具体的な数値は記載されておらず、物体の種類や環境を無制限に広げた性能までは分かりません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

細かな個体の違いを区別する物体(FO)操作では、ロボットが指定された物体を見た目の似た物体から見分け、場面内の妨害物があっても確実に行動する必要がある。しかし、場面全体を使った視覚条件付けには明示的な物体選択がなく、カテゴリ単位の誘導では同じカテゴリ内の個々の物体を確実に区別できない。本研究では、持続的な物体記憶と対象を絞った視覚条件付けによってこれらの課題に対処する、SAM3を用いた視覚運動の枠組みを提示する。 まず、FO Memory-driven SAM3(FOM-SAM3)を導入する。これはSAM3を完全に凍結したまま、少数の複数視点の登録画像から再利用可能な物体記憶トークンを学習する。1対残りの学習を通じて、これらのトークンは対象物の位置を特定し、似た別の物体を除外するための持続的な記憶を符号化し、メモリバンクに保存できる。次に、Focused Spatial-Appearance Encoding(FSAE)を提案する。これは対象物内の局所的な外観特徴と明示的なバウンディングボックス座標を組み合わせ、Diffusion Policy(DP)やAction Chunking with Transformers(ACT)などの行動方策を条件付けする。 提案したFOM-SAM3の有効性は、四つの大分類に属する実物30個からなるFO-30データセットで検証された。実ロボットによる三つの個体識別を伴う物体操作課題において、FOM-SAM3で誘導した方策は、妨害物への頑健性、類似物体間の識別能力、新たな物体への拡張可能性を示した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Fine-grained object (FO) manipulation requires robots to distinguish a specified FO from visually similar objects and execute actions reliably despite scene distractors. However, scene-level visual conditioning lacks explicit object selection, while category-level guidance cannot reliably distinguish FOs within the same category. We present a SAM3-guided visuomotor framework that addresses these challenges through persistent object memory and focused visual conditioning. First, we introduce FO Memory-driven SAM3 (FOM-SAM3), which learns reusable FO memory tokens from limited multi-view registration images while keeping SAM3 fully frozen. Through one-vs-rest learning, these tokens encode persistent memories for localizing target FOs and rejecting similar alternatives, which can be stored in a memory bank. Second, we propose Focused Spatial-Appearance Encoding (FSAE), which combines in-FO local appearance features with explicit bounding-box coordinates to condition action policies including Diffusion Policy (DP) and Action Chunking with Transformers (ACT). The effectiveness of the proposed FOM-SAM3 was validated on the FO-30 dataset comprising 30 physical objects across four coarse categories. Across three real-robot FO manipulation tasks, our FOM-SAM3-guided policies demonstrated robustness against distractors, discrimination ability among similar FOs, and extendibility to new FOs.

著者のコメント

8 pages, 7 figures. Submitted to IEEE ICRA 2027

arXiv ID: 2609.21621 / 要約の誤りについて