能動的な異視点物体地理位置推定
Towards Active Cross-View Object Geo-Localization
この論文をやさしく読む
ひとことで言うと
一枚の画像だけで物体の地理的位置を推定せず、次に見る場所と観測を終える時点も選ぶ枠組みです。
何に役立つ?
移動できる観測エージェントが、少ない追加視点で位置推定を改善する設計に役立ちます。
この研究の面白いところ
複数視点の統合、観測行動の教師あり初期化、精度向上と観測コストを釣り合わせる強化学習の3段階を使います。MoP-UAVでは平均1.45視点で最高性能と報告します。
どこまで分かった?
ゼロショット評価用に858シーン、1,716対象の集合も作っています。要旨には実機での移動時間やエネルギーを含む総コストの検証は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
異視点物体地理位置推定(CVOGL)は通常、固定されたクエリ画像を仮定しており、移動エージェントがより有益な観測を能動的に取得できることを見落としている。この制限に対処するため、能動的異視点物体地理位置推定(ActiveGeo)を導入する。ここではエージェントが新しい視点を順番に選び、いつ停止するかを決めることで、観測数を最小限にしながら位置推定の改善を目指す。さらに、3段階の学習を行うActiveGeoフレームワークであるActiveMoPTを提案する。第一に、多視点プロンプト保持適応により、初期プロンプトを再利用しながら複数のクエリ視点を統合する。第二に、軌跡誘導方策初期化では、教師ありのエージェント軌跡から視点選択と初期停止行動を学習する。第三に、コスト認識方策改良では、利得とコストに基づく報酬を持つGRPOを用いて、位置推定精度と観測効率を同時に最適化する。 また、858シーンと1,716個の対象アノテーションを含むゼロショットテストセットActiveGeo-858を構築した。実験では、ActiveMoPTは平均1.45枚のクエリ視点だけを使ってMoP-UAVで最先端の性能を達成し、ActiveGeo-858のゼロショット評価でも従来のCVOGL手法を大幅に上回った。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Cross-view object geo-localization (CVOGL) typically assumes a fixed query image, overlooking the ability of mobile agents to actively acquire more informative observations. To address this limitation, we introduce Active Cross-View Object Geo-Localization (ActiveGeo), where an agent sequentially selects new viewpoints and determines when to stop, aiming to improve localization with minimal observations. We further propose ActiveMoPT, an ActiveGeo framework with three-stage training. First, Multi-View Prompt-Preserving Adaptation enables the model to aggregate multiple query views while reusing the initial prompt. Second, Trajectory-Guided Policy Initialization uses supervised agent trajectories to learn viewpoint selection and initial stopping behavior. Third, Cost-Aware Policy Refinement employs GRPO with a gain-cost reward to jointly optimize localization accuracy and observation efficiency. We also construct ActiveGeo-858, a zero-shot test set containing 858 scenes and 1,716 target annotations. Experiments show that ActiveMoPT achieves state-of-the-art performance on MoP-UAV using only 1.45 query views on average, and substantially outperforms previous CVOGL approaches under zero-shot evaluation on ActiveGeo-858.
arXiv ID: 2609.19662 / 要約の誤りについて