少数画像からの3D再構成を深度・特徴・拡散モデルで改善
D3GS: Depth, DINO, and RGB Diffusion Co-Guided 3D Gaussian Splatting for Sparse-View Reconstruction
この論文をやさしく読む
ひとことで言うと
少ない画像から三次元の形状と新しい視点の画像を作る際、深度推定、画像特徴、拡散モデルを組み合わせる研究である。
何に役立つ?
撮影方向が限られる対象を3DGSで再構成するとき、形状の曖昧さや視点間の不整合を減らす方法の検討に役立つ。
この研究の面白いところ
深度による初期化、DINOによる視点間の整合、拡散モデルによる細部の改良を別々の役割として組み合わせ、要素ごとの効果も評価した。
どこまで分かった?
評価はDTU、LLFF、Mip-NeRF 360での実験で、要旨には具体的な改善値や実環境全般への一般化は示されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
少数の入力画像から新しい視点の画像を生成することは、3D Gaussian Splatting(3DGS)では依然として難しい。制約の少ない領域で形状が曖昧になり、視点間で整合しない部分や欠けた細部が生じ、再構成の質が下がり描画も不安定になる。これらに対し、深度、DINO、拡散モデルに導かれる少数視点ガウス再構成の枠組みD3GSを提案し、形状と見た目を同時に改善する。まず拡散モデルによる補完とDPT(Dense Prediction Transformer)による改良で、高解像度の実スケール深度マップを復元し、ガウス要素の頑健な初期化と幾何学的な制約を与える。次にDINOを利用した視点間で整合する学習を導入し、構造的な特徴でガウス要素の属性を拡張し、複数視点間の整合性を高める。最後に拡散モデルによるガウス要素の改良モジュールを使い、反復的な最適化に生成の事前知識を取り入れ、ガウス表現の形状と見た目の高周波の細部を改善する。DTU、LLFF、Mip-NeRF 360での実験では、D3GSは有力な基準手法に対して一貫して大きな改善を示し、構成要素を除く実験によって各要素の有効性と補完的な役割が確認された。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-19(UTC)
- 最新改訂
- 2026-09-19 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-19 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Novel view synthesis from sparse inputs remains challenging for 3D Gaussian Splatting (3DGS) due to ambiguous geometry, cross-view inconsistency, and missing details in under-constrained regions, resulting in degraded reconstruction and unstable rendering. To tackle these issues, we propose D$^{3}$GS, a Depth-DINO-Diffusion guided sparse-view Gaussian reconstruction framework that jointly enhances geometry and appearance. D$^{3}$GS first recovers a high-resolution, metric depth map via diffusion-based completion and DPT (Dense Prediction Transformer) refinement, providing robust Gaussian initialization and geometric constraints. Then, a DINO-guided view-consistent learning is introduced to augment Gaussian attributes with structural features, improving multi-view consistency. Finally, a diffusion-based Gaussian refinement module injects generative priors into an iterative optimization strategy, enhancing high-frequency geometric and appearance details within the Gaussian representation. Experiments on DTU, LLFF, and Mip-NeRF 360 show that D$^{3}$GS achieves consistent and substantial improvements over strong baselines, with ablation studies validating the effectiveness and complementary roles of each component.
arXiv ID: 2609.22941 / 要約の誤りについて