arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像と3次元形状の知識から編集可能なCADを復元

VGGT-CAD: Reconstructing Parametric CAD 3D Model with Geometric Grounding

Chunan Yu, Tianrun Chen, Fu Shen, Cheng Chen, Lanyun Zhu, Yang Yang

この論文をやさしく読む

ひとことで言うと

物体の画像から、形だけでなく後で編集できる設計操作の列も復元する研究です。カメラの位置関係や複数視点の形状情報を利用します。

何に役立つ?

考えられる用途は、画像や動画をもとに編集可能なCADモデルを起こす作業の支援です。復元結果をCADコマンド列として得ることが、単なる3次元画像の生成と異なります。

この研究の面白いところ

視点数が一定でなくても情報を融合し、推論時には補い合う視点を選びます。評価用のVideoCADも既存CADの多視点再描画から作っています。

どこまで分かった?

要旨には復元精度の数値や、実撮影画像と再描画データそれぞれの成績は示されていません。追加学習不要とされるのは視点選択戦略であり、枠組み全体が学習不要という意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

パラメトリックCADの復元には、視覚観測から正確な形状と編集可能なモデリング操作の両方を復元する必要があり、視点が限られ曖昧な場合には難しい。既存の方法は主に2次元の見た目の手掛かりに依存し、強い多視点幾何の事前知識を欠いている。本研究では、単一視点および複数視点の観測からパラメトリックCADを復元する、幾何を考慮した枠組みVGGT-CADを提示する。 カメラパラメータを条件トークンとして符号化し、画像トークンと共同でモデル化することで、事前学習済みの3次元幾何の事前知識をCAD復元へ移す。視点数の変化に対応するため、多視点の特徴を適応的に融合する可変視点の視点間文脈集約モジュールを導入する。さらに、推論時に相補的で信頼できるフレームを選ぶ、追加学習不要の幾何を考慮した視点選択戦略を開発する。得られた表現は、非自己回帰デコーダーでCADコマンド列へ復号される。 また、既存のCADデータを多視点で再描画することで、大規模な多視点動画ベンチマークVideoCADを開発する。広範な実験により、さまざまな観測構成における視覚的CAD復元でVGGT-CADが有効であることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Parametric CAD reconstruction requires recovering both precise geometry and editable modeling operations from visual observations, making it challenging under limited and ambiguous views. Existing methods mainly rely on 2D appearance cues and lack strong multi-view geometric priors. In this work, we present VGGT-CAD, a geometry-aware framework for parametric CAD reconstruction from single- and multi-view observations. We transfer pretrained 3D geometric priors into CAD reconstruction by encoding camera parameters as condition tokens and jointly modeling them with image tokens. To handle varying numbers of viewpoints, we introduce a variable-view cross-view context aggregation module that adaptively fuses multi-view features. We further develop a training-free geometry-aware view selection strategy to select complementary and reliable frames during inference. The resulting representation is decoded into CAD command sequences using a non-autoregressive decoder. We also develop VideoCAD, a large-scale multi-view video benchmark derived from existing CAD data through multi-view re-rendering. Extensive experiments demonstrate the effectiveness of VGGT-CAD for visual CAD reconstruction under different observation configurations.

arXiv ID: 2609.21225 / 要約の誤りについて