長い単眼映像から大域的に整合する3次元形状を再構成
GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction
この論文をやさしく読む
ひとことで言うと
長い単眼映像から3D空間を復元するとき、細部の形と長距離での軌跡の整合性を同時に改善する方法です。
何に役立つ?
大きな場面を少ない視点装置で記録し、全体の位置ずれを抑えて3D化する用途が考えられます。
この研究の面白いところ
単眼の形状情報をLoRAで取り込み、複数フレームの視線に共通の制約をかけます。最後に軌跡のつなぎ目も共同最適化し、分割処理で蓄積しやすいずれを減らします。
どこまで分かった?
代表的なSLAMと競争力のある軌跡精度を実験で報告しています。要旨にはGPUメモリ削減量やデータセット別の数値がなく、すべての大規模場面での保証ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
フィードフォワード型の3次元再構成は、画像列から効率よくシーンをモデル化する方法である。しかし、これらのモデルを大規模な単眼シーンに拡張する際には、過大なGPUメモリ使用量、局所形状の劣化、長期的な軌跡のずれが制約となる。既存のチャンク単位の最適化戦略では幾何学的制約が限られ、長い軌跡全体にわたる大域的な整合性を維持できない。 長い単眼画像列から安定して規模を拡大できるフィードフォワード型3次元再構成のための統合的な枠組みを提示する。提案法は、軽量な幾何学的事前情報の注入によって補強した、粗い段階から細かい段階への軌跡位置合わせを基礎とする。LoRA適応によって単眼画像からの幾何学的手掛かりをフィードフォワードの基幹モデルに蒸留し、推論効率を維持しながら細部構造の深度精度を改善する。 また、複合的な重みを用いる疎な光線場最適化を導入する。高周波の幾何学的特徴を使って局所点群の精緻化を導き、フレーム間で整合した光線制約を課す。従来のチャンク単位の手法と異なり、規模拡張性を保ちながら、フレーム間に強い幾何学的結合を確立する。最後に、光線誤差を同時最適化する効率的な軌跡接合戦略によって、蓄積したずれを明示的に減らす。広範な実験により、大規模シーンで大域的に整合した3次元再構成を維持しながら、代表的なSLAMシステムに匹敵する軌跡精度を達成することを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Feed-forward 3D reconstruction provides an efficient paradigm for scene modeling from image sequences. Scaling these models to large monocular scenarios are constrained by excessive GPU memory footprint, degraded local geometry, and long-term trajectory drift. Existing chunk-based optimization strategies provide limited geometric constraints and fail to maintain global consistency over extended trajectories. We present a unified framework for stable and scalable feed-forward 3D reconstruction from long monocular sequences. Our approach builds on coarse-to-fine trajectory alignment augmented by lightweight geometric prior injection. Distilling monocular geometric cues into the feed-forward backbone via LoRA adaptation improves depth accuracy on fine structures while preserving inference efficiency. We introduce a hybrid-weight sparse ray-field optimization that leverages high-frequency geometric features to guide local point-cloud refinement and enforce consistent inter-frame ray constraints. Unlike prior chunk-based methods, this establishes strong cross-frame geometric coupling while maintaining scalability. Finally, an efficient trajectory stitching strategy with joint ray-error optimization explicitly reduces accumulated drift. Extensive experiments show that our approach achieves competitive trajectory accuracy compared with representative SLAM systems, while maintaining globally consistent 3D reconstruction in large-scale scenarios.
著者のコメント
Accepted to ECCV 2026 as a Spotlight presentation
arXiv ID: 2609.20012 / 要約の誤りについて