arXiv論文メモ
新着一覧
cs.RO / cs.AI / cs.LG · 査読状況未確認

撮影順ではなくカメラ位置で記憶を使う移動計画AI

Visual Navigation Transformer with Pose Attention

Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

この論文をやさしく読む

ひとことで言うと

過去に見た景色を『いつ見たか』ではなく『どの位置と向きで見たか』で整理し、目的地までの移動に使う研究です。別々の走行で得た記録も組み合わせられます。

何に役立つ?

考えられる用途は、以前の探索経験を使う移動ロボットの経路計画です。明示的な地図を計画用に組み立てる代わりに、姿勢付き深度画像を環境の記憶として使います。

この研究の面白いところ

姿勢を単なる入力情報に加えるだけでなく、注意計算そのものを姿勢差に依存させます。同じ観測情報を使う比較で、移動性能と学習効率の改善を示しています。

どこまで分かった?

数値はHM3Dの検証場面での点目標移動の結果です。学習には正解メッシュ上の最短経路計画器を使い、実行にも現在姿勢が必要です。自己位置ノイズに強いという結果は、位置推定なしで動くことを意味しません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

学習型の移動方策は通常、観測を時間順の履歴として受け取り、位置符号化によって各観測を見た時点と結び付ける。このため、以前に環境を通った経験を再利用しにくい。経験を再利用するシステムは通常、地図や位相グラフなどの明示的な表現を作り、その上で計画する。本研究では、カメラ姿勢で索引付けした深度キーフレームの集合を文脈とするTransformer計画器、VNT-PA(Visual Navigation Transformer with Pose Attention)を提案する。 カメラ姿勢を位置符号化に使うことで、注意は時間順ではなくキーフレーム間の姿勢差に依存する。VNT-PAは、正解の場面メッシュ上で動作する最短経路計画器を模倣するよう学習し、現在の姿勢と目標位置だけで空間的文脈へ問い合わせ、行動を予測する。 HM3Dの検証用場面における点目標への移動で、成功率93.3%、経路長で重み付けした成功率(SPL)90.4%を達成した。同じ文脈を時間系列として符号化するベースラインや、姿勢を入力特徴として扱うベースラインを、移動性能と学習効率の両方で上回った。空間的文脈は姿勢で索引付けした集合であるため、テスト時に異なる軌道のフレームを融合できる。また、明示的な地図上で計画する従来のベースラインより、自己位置推定のノイズに対して性能が緩やかに低下する。これらの結果は、姿勢情報付きの経験が学習型計画器の環境表現として直接使え、注意を時間順ではなく姿勢差に依存させることで、学習が速まり長距離の移動が改善することを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Learned navigation policies typically consume observations as a temporally ordered history, with positional encodings tying each observation to when it was seen, making it difficult to reuse experience from earlier traversals of an environment. Systems that do reuse such experience usually construct an explicit representation, such as a map or a topological graph, and plan on it. We propose VNT-PA (Visual Navigation Transformer with Pose Attention), a transformer planner whose context is a set of depth keyframes indexed by camera pose. With camera poses as positional encoding, attention depends on the pose differences between keyframes rather than on their temporal order. VNT-PA is trained to imitate a shortest-path planner operating on the ground-truth scene mesh, predicting actions by querying the spatial context with only its current pose and the goal position. On point-goal navigation in HM3D validation scenes, VNT-PA reaches 93.3% success and 90.4% success weighted by path length (SPL), outperforming baselines that encode the same context as a temporal sequence or treat pose as an input feature, in both navigation performance and training efficiency. Because the spatial context is a pose-indexed set, frames from different trajectories can be fused at test time. The planner also degrades more gracefully under localization noise than a conventional baseline which plans on explicit maps. These results show that pose-stamped experience can serve directly as the environment representation for a learned planner, and that making attention depend on pose differences, rather than on temporal order, speeds up training and improves long-horizon navigation.

arXiv ID: 2609.21212 / 要約の誤りについて