arXiv論文メモ
新着一覧
cs.CV / cs.GR · 査読状況未確認

指示に応じて3D形状の部品を分割するPartLLM

PartLLM: A Unified Multimodal Foundation for 3D Part Segmentation

Zhe Zhu, Yiheng Zhang, Peng Li, Zixing Zhao, Honghua Chen, Yaqing Zhang, Le Wan, Zhiyang Dou, Cheng Lin, Yuan Liu, Mingqiang Wei, Wenping Wang

この論文をやさしく読む

ひとことで言うと

3D形状をどの部品に分けたいか、文章や操作で指定できるよう、複数の分割課題を一つのモデルで扱う研究。

何に役立つ?

3D形状の部品に名前を付けたり、ユーザーが指定した部位を取り出したりする作業に使うことが考えられる。要旨で示されたのは分割課題の実験であり、具体的な製品での運用結果ではない。

この研究の面白いところ

部品を一度に固定分類する代わりに、指示に応じた部品候補を順に生成し、それらから整合するマスクを同時に予測する。テキスト指示、対話操作、形状全体の分解を同じ設計で扱う。

どこまで分かった?

要旨は複数課題で専用手法を上回ったと述べるが、データセット名、数値差、失敗例は示していない。未知の形状や現場の操作でどこまで安定するかは、この要旨だけでは判断できない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

部品の分割は、コンピュータグラフィックスと3Dビジョンの基本的な課題である。近年の研究は、あらかじめ固定された分類にとどまらない3D部品分割へ対象を広げているが、既存の手法は通常、テキストで指示する部品分割や点による操作など、特定の設定だけを扱う。本研究では、これらの設定を、異なる入力指示によって求める部品の分け方を指定する、意図に条件づけられた生成問題として統一できると考える。このために、3D部品分割を自己回帰的な意味分解として定式化する、統合型のマルチモーダルモデルPartLLMを提案する。入力形状とユーザーの指示を条件として、PartLLMはマスク予測用のクエリとなる意味的な部品の仮説を自己回帰的に生成し、それらを分解の構造を考慮したデコーダーへ渡して、整合的な部品マスクを共同で予測する。この統合設計により、テキスト指示による部品分割、対話的な分割、分割の細かさを制御できる形状全体の意味分解を、単一のモデルで扱える。これらの課題設定にわたる広範な実験で、PartLLMは各課題専用の比較手法を一貫して上回った。これは、3D部品分割を意図に条件づけられた生成問題として統一する方法の有効性を示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Part segmentation is a fundamental problem in computer graphics and 3D vision. Recent works have expanded 3D part segmentation beyond fixed taxonomies, but existing approaches typically only address a specific setting, such as text-guided part segmentation or point-based interaction. In this work, we argue that these settings can be unified as an intent-conditioned generative problem, where different prompts specify the desired part decomposition. To this end, we introduce PartLLM, a unified multimodal model that formulates 3D part segmentation as autoregressive semantic decomposition. Conditioned on an input shape and a user prompt, PartLLM autoregressively generates semantic part hypotheses as queries for mask prediction and feeds them to a decomposition-aware decoder that jointly predicts coherent part masks. This unified design supports text-guided part segmentation, interactive segmentation, and full-shape semantic decomposition with controllable granularity within a single model. Extensive experiments across these task settings show that PartLLM consistently outperforms task-specific baselines, demonstrating the effectiveness of unifying 3D part segmentation under an intent-conditioned generative formulation.

著者のコメント

Accepted to SIGGRAPH Asia 2026 (ACM Transactions on Graphics). Project Page: https://czvvd.github.io/PartLLMPage/

arXiv ID: 2609.25832 / 要約の誤りについて