小さな物体地図で室内動画の撮影位置を推定
VideoReloc: Long-Term Indoor Video Relocalization against a Kilobyte-Scale Semantic Scene Graph
この論文をやさしく読む
ひとことで言うと
家具や照明が変わった室内でも、動画のどこを移動しているかを物体の配置から推定します。写真のような詳細な地図の代わりに、物体の種類と箱形の位置情報を使います。
何に役立つ?
考えられる用途は、保存容量を抑えたロボットや室内案内の位置推定です。二つの評価データセットでは、より大きな地図を使う比較手法より高い成功率を報告しています。
この研究の面白いところ
一瞬の画像では区別できない場所を、移動しながら集めた物体の並び方で区別します。場面に応じて動画の長さを変え、離れたクリップ間の矛盾も見直す設計です。
どこまで分かった?
その時点までの情報を使う因果的評価と、クリップ終了時の評価では成功率が異なります。90.6%などの高い値を即時推定の成績と混同できず、要旨の検証対象はRIO10とReplicaCADです。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
コンパクトな意味情報付きシーングラフが与えられたとき、長期的な室内動画の再位置推定は、照明や家具が変わった後にも地図座標系での軌跡を推定する。視覚的手法は見た目に依存するため、こうした変化の下では信頼性が低下する。一方、物体のクラスと幾何形状から1フレームずつ位置を求める方法では、根拠が乏しく曖昧になる。 私たちはVideoRelocを提案する。その適応型クリップは、物体と移動に関する基準を満たすまでオドメトリを使って空間的な根拠を集め、観測された場面に応じて照合する動画の長さを調整する。実行区間全体にわたる判断では、連結されたクリップを通じて蓄積した根拠を使って矛盾する配置を再確認し、隣接クリップの追跡だけでは得られない軌跡の安定性を実現する。仮説を先に立てる位置合わせは、三つ組の物体から姿勢を提案し、クリップ全体の物体中心とボックス表面を使って各仮説を検証する。向きを考慮した精密化では、ボックスの面、重力、壁の方向を用いてカメラの向きの曖昧さを解消し、位置と向きの全体を精密化する。 これにより、疎な地図に対する再位置推定を、空間的に広がりのある動画クエリの検証として捉え直す。識別に必要な根拠を保存済みの外観から時間的文脈へ移し、クラス名を付けたボックスからなる100 kBの地図を利用できるようにする。RIO10とReplicaCADでの全フレームに対する位置推定成功率は、誤差1 m・10度以内を基準とする因果的評価で、それぞれ73.5%と61.1%だった。クリップ終了時には90.6%と74.8%に上昇する。評価したフレーム単位のシーン座標回帰手法は、12.6~42 MBの地図を使い、それぞれ最大47.6%と49.8%に達した。プロジェクトページ:https://videoreloc.github.io
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Given a compact semantic scene graph, long-term indoor video relocalization estimates a map-frame trajectory after lighting and furniture changes. Visual methods rely on appearance and become unreliable under these changes; localizing one frame at a time from object classes and geometry instead leaves sparse, ambiguous evidence. We introduce VideoReloc, whose adaptive clips use odometry to gather spatial evidence until object and motion criteria are met, adapting query length to the observed scene. Its run-level decision rechecks conflicting placements using evidence accumulated across connected clips, stabilizing the trajectory beyond adjacent-clip tracking. Hypothesis-first registration proposes poses from object triplets and verifies each using clip-wide object centers and box surfaces. Orientation-aware refinement uses box faces, gravity and wall directions to resolve ambiguity in camera orientation and refine the full pose. This reframes sparse-map relocalization as verification of spatially extended video queries, moving discriminative support from stored appearance to temporal context and permitting a 100 kB map of class-labelled boxes. On RIO10 and ReplicaCAD, the all-frame localization success rate at 1 m/10$^\circ$ is 73.5% and 61.1% under causal evaluation, rising to 90.6% and 74.8% with clip closure. The evaluated per-frame scene coordinate regressors reach up to 47.6% and 49.8%, respectively, with maps of 12.6-42 MB. Project page: https://videoreloc.github.io
著者のコメント
8 pages, 3 figures, 4 tables. Project page: https://videoreloc.github.io
arXiv ID: 2609.21804 / 要約の誤りについて