画素に縛られない3Dガウシアン再構成を提案
VoxelTTO: Voxel-Aligned Feed-Forward 3D Gaussian Splatting with Test-Time Optimization
この論文をやさしく読む
ひとことで言うと
複数の写真から3Dシーンを作る際、各画素ごとに要素を置く代わりに、空間の区画であるボクセルに情報をまとめます。カメラ位置が分かる場合は、その情報でも補正します。
何に役立つ?
考えられる用途は、写真から作ったシーンを別の視点で表示したり、奥行きや撮影位置を復元したりすることです。
この研究の面白いところ
3D要素の配置方法、テスト時の軽量な調整、描画方法をまとめて見直しています。基盤モデル全体を再学習せず、再構成部分だけを訓練します。
どこまで分かった?
改善は3つのデータセットでの比較結果です。80 GPU時間は学習コストであり、1シーンの処理時間ではありません。要旨には具体的な精度改善量は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
近年のフィードフォワード型3D Gaussian Splatting(3DGS)手法は、通常、画素に対応付けられたガウシアン基本要素を回帰し、過度の重なりやアーティファクトを生じやすい。また、予測したカメラ姿勢の不正確さは、新規視点合成(NVS)の位置ずれにつながり得る。本研究では、任意の枚数の画像と、任意で与えられるカメラパラメータから、幾何学的に正確な3DGSシーンを再構成するフィードフォワード型の枠組みVoxelTTOを提示する。 VoxelTTOは密な画像特徴を大域的なボクセル表現へ集約し、ボクセル特徴からガウシアンを復号することで、画素とガウシアンの対応関係を切り離す。事前学習済み視覚基盤モデル(VFM)のパラメータを固定したまま既知のカメラパラメータを活用するため、姿勢の教師情報を使って軽量なLoRAモジュールを適応させるテスト時最適化(TTO)を導入する。さらに、学習時と推論時の標準的な3DGSラスタライズを確率的なソリッド体積レンダリングに置き換え、幾何学的忠実度を改善する。学習ではボクセルに対応付けたガウシアン再構成モジュールのみを更新し、80 GPU時間を要する。Replica、Tanks and Temples、DTUでの実験は、従来手法に比べてRGB-Dの新規視点合成とカメラ姿勢推定が改善することを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Recent feed-forward 3D Gaussian Splatting (3DGS) methods typically regress pixel-aligned Gaussian primitives, often causing excessive overlap and artifacts, while inaccuracies in predicted camera poses can lead to misalignment in novel-view synthesis (NVS). We present VoxelTTO, a feed-forward framework for reconstructing geometrically accurate 3DGS scenes from an arbitrary number of images and optional camera parameters. VoxelTTO aggregates dense image features into a global voxel representation and decodes Gaussians from voxel features, breaking the pixel-to-Gaussian correspondence. To exploit known camera parameters while keeping the pretrained visual foundation model (VFM) parameters frozen, we introduce test-time optimization (TTO) that adapts lightweight LoRA modules using pose supervision. We further replace vanilla 3DGS rasterization with stochastic solid volume rendering during training and inference, improving geometric fidelity. Training updates only the voxel-aligned Gaussian reconstruction modules, requiring 80 GPU hours. Experiments on Replica, Tanks and Temples, and DTU demonstrate improved RGB-D NVS and camera-pose estimation relative to prior methods.
arXiv ID: 2609.21498 / 要約の誤りについて