局所的な注意と全体の補正を組み合わせて長い映像から3Dを復元する
Think Locally, Refine Globally for Memory-Efficient 3D Reconstruction
この論文をやさしく読む
ひとことで言うと
長い映像から3D形状とカメラの動きを復元するとき、近い時刻どうしの処理と全体の位置関係の補正を分け、メモリを節約する研究です。
何に役立つ?
長い系列で計算量を抑えつつ、カメラ姿勢のずれが蓄積する問題に対処する方法になります。複数のベンチマークで深度と姿勢の推定を評価しています。
この研究の面白いところ
全フレーム同士を直接つなぐ代わりに、少数のブロックで窓間をつなぎ、コンパクトなトークンで全体の整合性を調整します。
どこまで分かった?
要旨にはメモリ削減量や精度改善の具体的な数値、評価系列の長さはありません。ストリーミング性能は競争力があるとの報告で、常に実時間処理できるという保証ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
長い画像系列の3D再構成に向け、局所的な時間モデリングと大域的なカメラの整合性を両立する、省メモリのフレームワークLoG-VGGTを提案する。全面的な大域アテンションに頼らず、一部の少数のTransformerブロックに窓をまたぐアテンションを導入する。これにより、メモリ使用量を抑えながら、隣接する時間窓の間で効果的に情報を伝える。 長期的な姿勢ドリフトを緩和するため、大域的なカメラ整合性を改良するモジュールも設計する。ここではカメラトークンがコンパクトなレジスタトークンとクロスアテンションを通じて相互作用し、系列全体にシーンレベルの制約を適用する。この設計によりカメラ表現を共同最適化でき、系列全体のアテンションに伴う高いコストなしに、長時間の姿勢安定性を大幅に改善する。広範な実験により、LoG-VGGTが複数の長系列ベンチマークで深度精度を改善し、頑健なカメラ姿勢推定を実現するとともに、ストリーミング再構成でも競争力のある性能を示すことを確認する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We propose LoG-VGGT, a memory-efficient framework for long-sequence 3D reconstruction that balances local temporal modeling with global camera consistency. Instead of relying on full global attention, our method introduces cross-window attention at a small subset of transformer blocks, enabling effective information propagation across adjacent temporal windows while keeping memory usage bounded. To mitigate long-term pose drift, we further design a global camera consistency refinement module, where camera tokens interact with compact register tokens via cross-attention to enforce scene-level constraints across the entire sequence. This design enables joint optimization of camera representations and significantly improves long-horizon pose stability without incurring the high cost of sequence-wide attention. Extensive experiments demonstrate that LoG-VGGT achieves improved depth accuracy and robust camera pose estimation across multiple long-sequence benchmarks, while delivering competitive streaming reconstruction performance.
著者のコメント
9 pages,4 figures
arXiv ID: 2609.21437 / 要約の誤りについて