arXiv論文メモ
新着一覧
cs.CV / cs.AI · 査読状況未確認

局所的な注意と全体の補正を組み合わせて長い映像から3Dを復元する

Think Locally, Refine Globally for Memory-Efficient 3D Reconstruction

Jingke Zhou, Chenhang Ma, Zhizhou Zhong, Mingkai Liu, Zhuang Zhou, Yicheng ji, Binghua Su, Bo Cai, Xianliang Huang

この論文をやさしく読む

ひとことで言うと

長い映像から3D形状とカメラの動きを復元するとき、近い時刻どうしの処理と全体の位置関係の補正を分け、メモリを節約する研究です。

何に役立つ?

長い系列で計算量を抑えつつ、カメラ姿勢のずれが蓄積する問題に対処する方法になります。複数のベンチマークで深度と姿勢の推定を評価しています。

この研究の面白いところ

全フレーム同士を直接つなぐ代わりに、少数のブロックで窓間をつなぎ、コンパクトなトークンで全体の整合性を調整します。

どこまで分かった?

要旨にはメモリ削減量や精度改善の具体的な数値、評価系列の長さはありません。ストリーミング性能は競争力があるとの報告で、常に実時間処理できるという保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

長い画像系列の3D再構成に向け、局所的な時間モデリングと大域的なカメラの整合性を両立する、省メモリのフレームワークLoG-VGGTを提案する。全面的な大域アテンションに頼らず、一部の少数のTransformerブロックに窓をまたぐアテンションを導入する。これにより、メモリ使用量を抑えながら、隣接する時間窓の間で効果的に情報を伝える。 長期的な姿勢ドリフトを緩和するため、大域的なカメラ整合性を改良するモジュールも設計する。ここではカメラトークンがコンパクトなレジスタトークンとクロスアテンションを通じて相互作用し、系列全体にシーンレベルの制約を適用する。この設計によりカメラ表現を共同最適化でき、系列全体のアテンションに伴う高いコストなしに、長時間の姿勢安定性を大幅に改善する。広範な実験により、LoG-VGGTが複数の長系列ベンチマークで深度精度を改善し、頑健なカメラ姿勢推定を実現するとともに、ストリーミング再構成でも競争力のある性能を示すことを確認する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We propose LoG-VGGT, a memory-efficient framework for long-sequence 3D reconstruction that balances local temporal modeling with global camera consistency. Instead of relying on full global attention, our method introduces cross-window attention at a small subset of transformer blocks, enabling effective information propagation across adjacent temporal windows while keeping memory usage bounded. To mitigate long-term pose drift, we further design a global camera consistency refinement module, where camera tokens interact with compact register tokens via cross-attention to enforce scene-level constraints across the entire sequence. This design enables joint optimization of camera representations and significantly improves long-horizon pose stability without incurring the high cost of sequence-wide attention. Extensive experiments demonstrate that LoG-VGGT achieves improved depth accuracy and robust camera pose estimation across multiple long-sequence benchmarks, while delivering competitive streaming reconstruction performance.

著者のコメント

9 pages,4 figures

arXiv ID: 2609.21437 / 要約の誤りについて