対話で経路の誤りを修正する視覚言語ナビゲーション
Talk2Escape: Conversational Grounding for Vision-and-Language Navigation
この論文をやさしく読む
ひとことで言うと
道に迷ったり経路を外れたりしたロボットが、状況に応じて質問し、助言を受けて進路を修正する方法。
何に役立つ?
視覚と言語で移動するエージェントの誤差回復に役立つ可能性がある。シミュレーターと四足歩行ロボットで評価している。
この研究の面白いところ
運動状態を監視して、同じ場所の巡回や大きな逸脱を検出したときだけ、現在の視点に基づく短い質問を生成する。
どこまで分かった?
R2R-CEでの成功率66.0%はそのベンチマークの結果である。実機でも改善を報告するが、要旨には実機での試行数や改善幅は記載されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚言語ナビゲーション(VLN)は大きな成果を上げているが、一般的な一往復だけの指示方式では、エージェントが厳密に開ループで動くという弱点がある。実際には、似た景色の取り違え、センサー雑音、自己位置推定のずれによる小さな誤差が時間とともに蓄積し、修正機構がないまま任務全体の失敗に至りうる。これに対しTalk2Escapeは、モデルに依存せず、必要なときに先回りして対話を始める枠組みによって、ナビゲーションを閉ループの対話過程に変える。 軽量な視覚言語モジュールがエージェントの運動状態を継続的に監視し、局所的な同じ場所の巡回や大きな経路逸脱を検出すると、エージェント視点の生の観測を、状況に即した簡潔な質問へ変換する。そしてアルゴリズムによる助言者または人から、的を絞った修正フィードバックを得る。R2R-CE、RxR-CE、VLNVerseを含む高忠実度シミュレーターでの広範な評価では、多様な基礎エージェントに一貫した改善が見られた。R2R-CEでは成功率66.0%を達成し、既存の教師ありおよびゼロショットの最高水準手法を上回った。さらに、四足歩行ロボットUnitree Go2でシミュレーションから実環境への転移を検証し、先回りした対話が物理環境でのナビゲーションの頑健性を大きく改善すると示した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
While Vision-and-Language Navigation (VLN) has demonstrated remarkable success, the prevailing single-turn paradigm exposes a fundamental vulnerability: agents operate in a strictly open-loop manner. In practice, factors such as perceptual aliasing, sensor noise, and odometry drift can cause minor deviations to accumulate over time, often leading to catastrophic mission failures with no built-in mechanism for error recovery. To address this, we introduce \textit{Talk2Escape}, a proactive and model-agnostic dialogue intervention framework that reframes navigation as a closed-loop interactive process. At its core, a lightweight vision-language module continuously monitors agent kinematics. Upon detecting localized looping or severe trajectory divergence, it translates raw egocentric observations into concise, grounded queries to solicit targeted corrective feedback from either an algorithmic oracle or a human-in-the-loop. Extensive evaluations in high-fidelity simulators, including R2R-CE, RxR-CE, and VLNVerse, demonstrate that \textit{Talk2Escape} exhibits consistent improvements across diverse base agents. Empirically, \textit{Talk2Escape} achieves a 66.0\% Success Rate on R2R-CE, outperforming the current supervised and zero-shot state-of-the-art methods. We further validate its sim-to-real transfer on a Unitree Go2 quadruped, proving that proactive dialogue drastically improves navigation robustness in physical environments.
著者のコメント
IROS 2026
arXiv ID: 2609.28296 / 要約の誤りについて