arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

深度画像と文章指示で移動ロボットを制御する視覚言語モデル

"Dear LLaVA, Please Drive": A Depth-Aware Vision-Language Agent for Closed-Loop Robotic Control

Sebastian Berger, Katharina Winter, Fabian B. Flohr

この論文をやさしく読む

ひとことで言うと

深度観測と文章指示を使い、正解の走行軌跡を大量に用意せずに移動ロボットの経路を学習する研究。

何に役立つ?

考えられる用途は、文章で移動先を指定するロボットの経路計画である。要旨では未見の環境での評価と、実機での定性的な確認が述べられている。

この研究の面白いところ

正解軌跡の模倣に代えて、微分可能な幾何学的コスト場で学習し、モデルの1%未満のパラメータ更新に抑えている。

どこまで分かった?

要旨はSPLの具体値や比較対象を示していない。実世界の評価は定性的と記され、定量的な実機成功率は分からない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚言語モデル(VLM)は、広い文脈理解と大規模な事前学習による汎化能力を備え、推論に基づく移動ナビゲーションの基盤となり得る。既存の多くのナビゲーション手法は模倣学習に依存し、大量の正解軌跡データを必要とするため、拡張性や頑健性に制約がある。本研究は、命令型学習の枠組みで事前学習済みVLMを自律移動向けに効率よく微調整する方法を提案する。正解軌跡ではなく微分可能な幾何学的コスト場に対して最適化することで、ステレオ視による深度観測だけから衝突を避ける経路を生成するよう学習する。 自然言語の指示に基づくロボット制御のため、端から端までの統一したナビゲーション処理を導入する。共有VLMを基盤に、タスク別の低ランク適応(LoRA)モジュールを組み合わせ、意味に基づく目標選択から低レベルの軌道計画までつなぐ。モデルの全パラメータの1%未満だけを更新しながら、未見の環境で、経路長を考慮した成功率(SPL)において競争力のある結果を得た。実世界での定性的な実験では、実世界データによる微調整なしでも、シミュレーションから実機への汎化と安定した経路計画が確認された。これらは、大規模な正解軌跡データを必要とせず、高度な意味理解に基づく移動をVLM搭載ロボットに実装する方法を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-19(UTC)
最新改訂
2026-09-19 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-language models (VLMs) provide a compelling foundation for reasoning-driven mobile navigation, offering rich contextual understanding and strong generalization from large-scale pretraining. Most existing navigation frameworks rely on imitation learning and therefore require substantial labeled trajectory data, limiting their scalability and robustness. In this work, we propose a parameter-efficient approach to fine-tune a pretrained VLM for autonomous navigation using an Imperative Learning paradigm. By optimizing against differentiable geometric cost fields rather than labeled trajectories, our model learns to generate collision-free paths exclusively from stereoscopic depth observations. We introduce a unified end-to-end navigation pipeline for natural-language-driven robotic control. This system leverages a shared VLM backbone with task-specific Low-Rank Adaptation (LoRA) modules, effectively bridging the gap from semantic target selection to low-level trajectory planning. Our approach achieves competitive Success weighted by Path Length (SPL) in unseen environments while updating less than 1% of the model's total parameters. Qualitative real-world experiments validate sim-to-real generalization and stable path planning without fine-tuning on real-world data. These results highlight a practical approach for deploying VLM-based agents on mobile robots, enabling high-level semantic navigation without the prohibitive requirement for large-scale, labeled trajectory data.

arXiv ID: 2609.22925 / 要約の誤りについて