arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

人向け地図からロボットの移動指示を作る

NaViRrator: Robot Navigation from Human-Readable Maps through a Learned Visual Route

Ayun Lee, Jiseon Kim, Giseop Kim

この論文をやさしく読む

ひとことで言うと

人向けの地図に出発点と目的地を指定すると、まず経路を描き、その経路をロボットが理解できる言葉の指示に変換します。

何に役立つ?

地図の解釈部分と実際に移動する方策を分けることで、実行側を交換しやすいナビゲーションの構成に役立ちます。

この研究の面白いところ

地図を直接文章にする前に、座標上の経路を明示する段階を置いています。出発点と目的地の直線を変形させて経路を作る方法も特徴です。

どこまで分かった?

要旨では実環境の成功率とSPLの向上が報告されていますが、数値や環境数は記載されていません。さまざまな地図形式や未知の建物すべてへの適用が確認されたわけではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

人が読める地図は、ロボットの目的地を指定する直感的なインターフェースになる。しかし、その模式的な幾何形状をロボット自身の視点からの観測に結び付けることは依然として難しい。私たちは、このような地図上でユーザーが指定した出発点と目的地を、事前学習済みの視覚言語ナビゲーション(VLN)方策への移動指示に変換する枠組みNaViRRatorを提示する。 中核手法のRouteScribeは、最初に地図画像の座標上で明示的な経路の骨組みを生成し、それを事前学習済みの視覚言語モデル(VLM)が移動指示に変換することで、経路推定と言語化を分離する。この骨組みは、出発点と目的地を結ぶ直線を用いた条件付きフローマッチング(SGL-CFM)によって構成する。これは、直線上に並べた経由点列を、地図を条件とした経路へ変形するものである。 実行中、VLN方策が受け取るのは指示と自己視点の観測だけであり、地図と経路の骨組みは上流側にとどまる。そのため、地図から言語への変換モジュールを再学習せずに、実行側を交換できる。実環境での実験は、地図から指示を直接生成する方法、A*に基づく骨組み生成、ガウス分布を出発分布とする条件付きフローマッチングと比べて、高い成功率と経路長で重み付けした成功率(SPL)を示した。定性的な結果も、重要な曲がり角がより明確になり、意図した移動動作の順序がよく保たれることを示す。これは、経路に根差した言語を、人が読める地図と事前学習済みのナビゲーション方策の間の、モジュール化されたインターフェースとして用いることを支持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Human-readable maps provide an intuitive interface for specifying robot destinations, but connecting their schematic geometry to egocentric observations remains challenging. We present NaViRRator, a framework that translates user-specified start and goal locations on such maps into navigation instructions for a pretrained vision-and-language navigation (VLN) policy. Its core method, RouteScribe, separates route inference from verbalization by first generating an explicit route scaffold in map-image coordinates, which a pretrained vision-language model (VLM) converts into a navigation instruction. We construct the scaffold with start--goal line conditional flow matching (SGL-CFM), which deforms a straight start--goal waypoint sequence into a map-conditioned route. During execution, the VLN policy receives only the instruction and egocentric observations, while the map and scaffold remain upstream, allowing executor replacement without retraining the map-to-language modules. Real-world experiments show higher success rates and success weighted by path length (SPL) than direct map-to-instruction generation, A*-based scaffolding, and Gaussian-source conditional flow matching. Qualitative results further show clearer salient turns and better preservation of the intended maneuver sequence, supporting route-grounded language as a modular interface between human-readable maps and pretrained navigation policies.

著者のコメント

8 pages, 7 figures

arXiv ID: 2609.21316 / 要約の誤りについて