arXiv論文メモ
新着一覧
cs.RO / cs.CV · 査読状況未確認

座標なしの視覚的な場所のつながりでロボットを案内

Navi-Agent: Unlocalized Monocular Navigation Agent

Wenyuan Xie, Mengyang Hong, Yongzhong Wang, Yanbiao Ji, Yijin Zhou, Shaokai Wu, Shalayiding Sirejiding, Huayi Zhou, Yi-Chao Chen, Ma Ling, Yue Ding, Hongtao Lu

この論文をやさしく読む

ひとことで言うと

正確な座標地図の代わりに、見た場所と移動のつながりを記録して、指示どおりに移動するエージェントです。

何に役立つ?

未知の環境で長い移動指示を実行し、進み具合の確認や失敗からの復旧を行うロボットの設計に役立ちます。

この研究の面白いところ

場所の見え方と実行した動きを組み合わせ、座標なしでも再訪や進捗を確認します。単に目の前の画像だけで進むのではなく、履歴を空間状態として保ちます。

どこまで分かった?

ベンチマークと実機での評価が報告されていますが、要旨には具体的な成功率や環境数はありません。座標を使わない一方、視覚的な近似自己位置推定は行っている点に注意が必要です。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

連続環境での視覚言語ナビゲーション(VLN-CE)では、身体を持つエージェントが、未知の環境で長期的な指示を実行しなければならない。既存のゼロショットVLN-CEシステムは通常、幾何学的な自己位置推定や座標に基づく表現によって空間状態を維持する。最近の、幾何情報に制約を設けたナビゲーションは、奥行きと全体として整合した座標を不要にしたが、場所の確認、進捗の検証、復旧に必要な持続的な空間認識の維持は、なお難しい。 本研究では、視覚観測と実行済みの移動履歴から、座標を使わない空間状態を構成する、ゼロショットVLN-CEエージェントNavi-Agentを提示する。Navi-Agentはこの状態をナビゲーションのトポロジーとして整理し、ノードで視覚的な場所を、エッジで移動による遷移を表す。この表現によって、観測に基づく近似的な自己位置推定、課題の進捗検証、視覚的な再訪を用いた復旧が可能になる。 Navi-Agentは、指示を副目標へ分解し、局所的な視覚ナビゲーションを実行し、構築した空間状態を通じて訪問した場所を検証することで、閉ループのナビゲーションを行う。ゼロショットVLN-CEベンチマークと実世界のロボットプラットフォームでの実験では、幾何情報に制約を設けた方法の中で最先端の性能を達成しながら、幾何学的な自己位置推定に依存する方法にも対抗できる性能を示した。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-18 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-Language Navigation in Continuous Environments (VLN-CE) requires an embodied agent to execute long-horizon instructions in unknown environments. Existing zero-shot VLN-CE systems typically maintain spatial states through geometric localization or coordinate-based representations. Recent geometry-constrained navigation removes depth and globally consistent coordinates, but maintaining persistent spatial awareness for place confirmation, progress verification, and recovery remains challenging. We present Navi-Agent, a zero-shot VLN-CE agent that constructs a coordinate-free spatial state from visual observations and executed motion histories. Navi-Agent organizes this state as a navigation topology, where nodes represent visual places and edges represent motion transitions. This representation enables observation-based approximate self-localization, task progress verification, and visual revisitation-based recovery. Navi-Agent performs closed-loop navigation by decomposing instructions into sub-goals, executing local visual navigation, and verifying visited places through the constructed spatial state. Experiments on zero-shot VLN-CE benchmark and real-world robot platforms show that Navi-Agent achieves state-of-the-art performance among geometry-constrained methods while remaining competitive with approaches relying on geometric localization.

著者のコメント

8 pages, 7 figures

arXiv ID: 2609.20388 / 要約の誤りについて