arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

物体と経路を一つのグラフにして言葉で指定した場所へ移動する

A Topological Representation with Object-Path Graphs for Open-Vocabulary Instance Navigation

Linwei Zheng, Daojie Peng, Bingtao Wang, Haoang Li, Jun Ma

この論文をやさしく読む

ひとことで言うと

言葉が指す物体を探すための意味情報と、そこへ行くための経路を、一つの軽量なグラフにまとめるロボット移動方式です。

何に役立つ?

考えられる用途は、自然言語で指定された物体へロボットを移動させることです。密な距離地図の再構成に頼らず、グラフ内の位置推定と局所制御で移動する構成です。

この研究の面白いところ

物体認識用の記憶と移動用の地図を別に持つ設計の隔たりを埋めます。全体の経路計画と、隣のノードへ進む視覚制御を組み合わせています。

どこまで分かった?

HM3D・Replicaでの評価と実ロボット実験を報告しますが、要旨には成功率、環境規模、実機試行数はありません。密な距離再構成が不要という点は、環境情報が何も必要ないという意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚言語ナビゲーションでは、身体を持つエージェントが自然言語の指示と視覚観測を使って環境内を移動する必要がある。既存手法は一般に、移動を言語に導かれる逐次的な判断へ分解するか、環境の事前知識なしのオンライン探索に依存する。シーングラフ表現はコンパクトな意味記憶を提供するが、後段の移動処理とは切り離されており、その移動処理は依然として密な距離地図に依存する。 この隔たりを埋めるため、自由語彙の意味推論と位相的なナビゲーションを統合する物体–経路グラフを提案する。この表現は、意味と対象の対応付け、グラフに基づく自己位置推定、移動を、一つの軽量な位相的枠組みで同時に支える。このグラフに基づき、大域的な経路計画と、軽量なノード位置特定および意味に基づく視覚サーボを使った局所的なノード間移動を組み合わせる戦略を導入する。密な距離情報の再構成をせずに、グラフ上で直接移動できる。 HM3DとReplicaでの実験は、提案する階層的グラフ構造によって、自由語彙の物体対応付けで競争力のある性能を得るとともに、有効な移動性能を達成することを示す。さらに実世界のロボット実験により、提案する枠組みの実用性を検証する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-language navigation requires embodied agents to navigate environments using natural language instructions and visual observations. Existing approaches typically decompose navigation into sequential language-guided decisions or rely on online exploration without prior environmental knowledge. Scene graph representations offer compact semantic memory but remain decoupled from downstream navigation, which still depends on dense metric maps. To close this gap, we propose an object--path graph that unifies open-vocabulary semantic reasoning with topological navigation. The proposed representation jointly supports semantic grounding, graph-based localization, and navigation within a single lightweight topological framework. Building on this graph, we introduce a navigation strategy that combines global path planning with local inter-node execution through lightweight node localization and semantic visual servoing, enabling navigation directly over the graph without dense metric reconstruction. Experiments on HM3D and Replica demonstrate competitive performance in open-vocabulary object grounding through the proposed hierarchical graph structure, while achieving effective navigation performance. Real-world robot experiments further validate the practicality of the proposed framework.

著者のコメント

8 pages, 6 figures

arXiv ID: 2609.24189 / 要約の誤りについて