視点の違いに強いイベントカメラの場所認識
Multi-viewpoint Geo-localization with Event Cameras
この論文をやさしく読む
ひとことで言うと
カメラの向きが前回と違っても同じ場所だと分かるよう、明るさの変化を捉えるイベントカメラ用の場所認識を学習させる研究です。
何に役立つ?
考えられる用途は、異なる向きから通った場所でも過去の記録と照合するロボットの自己位置推定です。通常の画像データを合成イベントに変えることで学習データも補っています。
この研究の面白いところ
通常の位置情報付き画像データ5つを活用し、イベントデータ不足に対応しています。新たに、同じ3.7kmの経路を3方向で記録した視点変化の評価集も作っています。
どこまで分かった?
82%は既存の3データセットでの平均Recall@1で、全走行の位置推定成功率ではありません。新データセットでの改善は9ポイントと別に報告されており、両者を同じ評価結果として扱えません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ロボットの自己位置推定は継続的な課題であり、視点の変化に耐えられる地図作成・測位システムを必要とする。イベントカメラはロボティクスで関心と導入が広がっているが、既存のイベントベースの位置推定器では、視点の違いへの対応は十分に研究されていない。また、難しい位置推定状況で視点変化に重点を置いたイベントデータセットも不足している。 本研究では、視点変化のもとで頑健に動作するイベントベースの視覚的場所認識(VPR)システムを導入する。従来はフレームベースの位置推定システムの学習に用いられてきた、大規模な位置情報付きデータセット5つを、Image-to-Event(I2E)変換によって合成イベントストリームへ変換した。これらを使い、複数の損失関数で事前学習済みのイベントベースのVision Transformerを微調整した。得られたシステムMegaEventは、場所認識のための視点に頑健な特徴を学習する。 既存のイベントベース位置推定データセット3つで、平均Recall@1が82%となった。次点のイベントベース手法を20ポイント、イベントフレームに直接適用したフレームベースVPRモデルを8〜26ポイント上回った。さらに、3.7kmの徒歩経路を3つのカメラ方向で記録した、合計11.1kmの新しい難しいデータセットSpringfield-Event-VPRを導入する。このデータセットでMegaEventは最も強いベースラインを再現率で9ポイント上回った。コードは https://github.com/AdamDHines/megaevent で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Robot localization is an ongoing challenge that demands mapping and positioning systems that are tolerant to viewpoint change. Event cameras are attracting increasing interest and adoption in robotics; however, dealing with viewpoint variance is an under-investigated problem in existing event-based localizers. In addition, event-based datasets that emphasize viewpoint variance for challenging localization situations are scarce. Here, we introduce an event-based visual place recognition (VPR) system that performs robustly under viewpoint changes. We converted five large-scale geo-tagged datasets, conventionally used to train frame-based localization systems, into synthetic event streams using Image-to-Event (I2E) conversion, and used them to fine-tune a pre-trained event-based vision transformer backbone with a multi-loss function, yielding a system we call MegaEvent that learns viewpoint-robust features for place recognition. We achieved an average Recall@1 of 82% across three existing event-based localization datasets, leading the next best event-based method by 20 recall points, and frame-based VPR models applied directly to event frames by 8 to 26 recall points. We introduce a new, challenging dataset - Springfield-Event-VPR - which features a 3.7km walking route recorded in three camera orientations for a total of 11.1km, which MegaEvent outperforms the strongest baseline by 9 recall points. The code for MegaEvent is available at https://github.com/AdamDHines/megaevent.
著者のコメント
8 pages, 4 figures, 4 tables, under review
arXiv ID: 2609.21219 / 要約の誤りについて