arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

合成画像だけで学び、実物の姿勢を推定するGenCOPE

GenCOPE: Syn2Real Generalized Category-Level Object Pose Estimation for Robotic Picking

Jian Liu, Wei Sun, Zhenqi Dai, Hui Yang, Jian Xiao, Nicu Sebe, Na Zhao

この論文をやさしく読む

ひとことで言うと

合成データで学んだロボットの物体姿勢推定を、実物の見え方にも適応しやすくする手法です。

何に役立つ?

新しい物体カテゴリを扱うロボットで、現実の学習データを集め直す負担を減らす用途が考えられます。ベンチマークに加え、実際のロボット操作場面でも評価しています。

この研究の面白いところ

合成画像と実画像の表面的な違いに引きずられないよう、2次元と3次元の意味的な共通性を制約として使います。大域特徴だけで扱う軽量な構成も特徴です。

どこまで分かった?

対象はカテゴリ内の未知物体への一般化です。要旨には個々の精度、推論速度、把持成功率の値がなく、任意の未知カテゴリにそのまま対応できることまでは示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

カテゴリ単位の物体姿勢推定(COPE)は、同じクラスに属する未知の物体にも一般化でき、ロボットによる3次元場面理解の中核的技術になっている。しかし、既存のCOPE手法では、新しい物体カテゴリごとに、手間のかかる現実世界の学習データ収集を改めて行う必要があり、実用での拡張性が制限される。 本論文は、描画した合成データだけでモデルを学習し、そのまま現実世界での利用へ一般化する、合成から現実への(Syn2Real)汎化型COPEを目指す。中心的な課題は、特にテクスチャの見え方における、合成データと現実データの大きなドメイン間の隔たりである。そこで、同一カテゴリ内の物体に共通する意味的特徴を捉える、ドメインに依存しない表現を学び、ドメイン一般化を高めることを目指す。 特徴エンコーダがドメイン固有の特徴に敏感になりすぎないよう、2次元と3次元の意味的一貫性制約を導入する。さらに、密な異種情報間の融合を使って姿勢推定を改善する、2次元・3次元間の相互一貫性学習を行うエンドツーエンド姿勢回帰の枠組みを提案する。実際のロボットへの導入には単純さと有効性が重要なため、モデルは大域的な特徴だけを扱い、非常に軽量で効率的な構成を実現する。 REAL275およびWild6Dベンチマークと、現実のロボット操作場面における広範な実験で、この方法の優れたSyn2Real汎化性能を示した。コードとデモは https://paperreview99.github.io/GenCOPE/ で公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Category-level object pose estimation (COPE), capable of generalizing to intra-class unknown objects, has become a core technique for robotic 3D scene understanding. However, existing COPE methods still require labor-intensive recollection of real-world training data for novel object categories, which limits their scalability in practical applications. This paper aims to achieve synthetic-to-real (Syn2Real) generalized COPE, where a model is trained solely on rendered synthetic data and directly generalized to real-world deployments. The central challenge lies in the significant domain gap between synthetic and real-world data, particularly in texture appearance. To address this, we aim to enhance domain generalization by learning domain-invariant representations that capture semantic commonalities among objects within the same category. We introduce 2D and 3D semantic consistency constraints to reduce the sensitivity of feature encoders to domain-specific features. In addition, we propose an end-to-end pose regression framework that performs 2D-3D cross consistency learning, leveraging dense cross-modality fusion to further refine pose estimation. Since simplicity and effectiveness are essential for real-world robotic deployment, our model operates exclusively on global features, yielding a highly lightweight and efficient architecture. Extensive experiments on the REAL275 and Wild6D benchmarks, as well as real-world robotic manipulation scenes, show superior Syn2Real generalization performance of our paradigm. Code and demos are released at https://paperreview99.github.io/GenCOPE/.

著者のコメント

Accepted by NeurIPS'26

arXiv ID: 2610.01758 / 要約の誤りについて