arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

複数視点すべての形状を同時に推定するステレオ再構成

Revisiting Multi-View Stereo: A Sequence-to-Sequence Formulation

Aoxiang Fan and Corentin Dumery and Nicolas Talabot and Pascal Fua

この論文をやさしく読む

ひとことで言うと

カメラの位置などが既知の複数画像を使い、ある一枚の奥行きだけでなく、全視点の形状をまとめて求める方法です。

何に役立つ?

複数の撮影画像から3次元形状を復元する際の精度改善に役立ちます。既知のカメラ情報を使う設定が前提です。

この研究の面白いところ

画像ごとの個別処理にせず、光線情報と全視点共通のコストボリュームを組み合わせて3次元構造を捉えています。

どこまで分かった?

要旨には各ベンチマークの数値や計算資源の比較はありません。カメラパラメータが未知の場合の性能や、すべての場面で歪みを除けることまでは示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数視点の画像から正確な形状を計算することは、コンピュータービジョンの基本問題である。近年のフィードフォワード(FF)モデルは3次元形状とカメラパラメータを同時に推定するが、正解のカメラパラメータを与えても、再構成の曖昧さによる形状の歪みが生じがちである。 本論文では、カメラパラメータが既知の多視点ステレオ(MVS)問題を調べ、従来のMVSとFF手法を橋渡しする新しい方法を提案する。MVSを、単一の参照視点の深度だけを予測する多対一の系列写像とするのではなく、FFモデルと同様の系列対系列タスクとして捉え直し、入力されたすべての視点の形状を同時に予測する。 カメラから得られる事前情報を明示的に使う二つの要素を持つ、大域的なTransformerアーキテクチャを導入する。一つは、カメラパラメータを画像パッチのトークンに注入し、Transformerにカメラ情報を認識させる光線マップ埋め込みである。もう一つは、従来の視点ごとのコストボリュームに代わって、全視点の3次元構造を共同で捉える、統一された大域的コストボリュームである。複数の公開ベンチマークでの広範な実験により、提案手法がMVSとFFの両方の再構成ベースラインを上回り、最先端の性能を達成することを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Computing accurate geometry from multi-view images is a fundamental problem in computer vision. Recent feed-forward (FF) models jointly estimate 3D geometry and camera parameters, but they typically suffer from geometry distortion caused by reconstruction ambiguity, even when ground-truth camera parameters are supplied. In this paper, we study the multi-view stereo (MVS) problem with known camera parameters and propose a novel approach that bridges conventional MVS and FF methods. Rather than casting MVS as a sequence-to-one mapping that predicts depth only for a single reference view, we reformulate it as a sequence-to-sequence task, akin to FF models, that jointly predicts geometry for all input views. We introduce a global transformer-based architecture with two components that explicitly exploit camera-induced priors: ray-map embeddings that inject camera parameters into image patch tokens, making the transformer camera-aware, and a unified global cost volume that replaces conventional per-view cost volumes to jointly capture 3D structure across all views. Extensive experiments on multiple public benchmarks show our approach achieves state-of-the-art performance, surpassing both MVS and FF reconstruction baselines.

arXiv ID: 2609.24850 / 要約の誤りについて