arXiv論文メモ
新着一覧
cs.RO / cs.CV · 査読状況未確認

視覚と言語で移動するモデルの判断根拠と内部制御を調べる

What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior

Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak, Marco Hutter, Cordelia Schmid, Lukas Rosenberger Schmid, Wolfram Burgard

この論文をやさしく読む

ひとことで言うと

画像と指示を使って移動するAIが、どの入力を判断に使うかを介入で調べ、内部の活性を変えて行動を調整しています。

何に役立つ?

移動モデルの判断を点検し、追加学習なしで未知の実世界状況での行動を改善する方法を検討するうえで役立ちます。

この研究の面白いところ

入力への依存を見るだけでなく、進行状況や意味概念が内部に表されることを利用し、行動の活性ベクトルを別の状況へ転移しています。

どこまで分かった?

要旨には対象モデル数、実世界場面の規模、改善率は示されていません。調べた方策の結果であり、すべてのVLNモデルの判断根拠や安全性が解明されたという主張ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

現代の視覚言語ナビゲーション(VLN)モデルは、移動行動の予測を主に事前学習済みの大規模視覚言語モデル(VLM)に依存している。言語指示と視覚観測の融合はマルチモーダルな推論を可能にする一方、情報がモダリティ間でどのように流れ、どの仕組みが移動判断を駆動するのかを見えにくくする。このため、VLNモデルが関連する意味的手掛かりに基づいて予測しているのか、課題の進み具合を追跡できるのかは、依然として不明である。 本研究ではVLNモデルの解釈可能性と制御可能性を調べる。視覚観測、指示、視覚記憶が移動判断に与える因果的な影響を測る、介入に基づく指標を用いる。結果は、これらの移動方策が入力のすべてのモダリティに感応し、単一のモダリティだけには依存していないことを示す。さらに、これらのエージェントは移動の進行状況を符号化し、基盤のVLMから意味的な構造を保持しているため、内部活性を通じて概念水準で制御できることを示す。最後に、抽象的な行動に対応する活性ベクトルを取り出し、分布外の実世界の状況へゼロショットで転移させる。これにより、追加の微調整なしに性能を改善する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Modern Vision-Language Navigation (VLN) models rely mostly on pre-trained large Vision-Language Models (VLMs) to predict navigation actions. While this fusion of language instructions and visual observations allows multimodal reasoning, it obscures how information is routed across modalities or what mechanisms drive navigation decisions. Thus, it remains unclear whether VLN models ground their predictions in relevant semantic cues or can track task progress. In this work, we study the interpretability and steerability of VLN models. We use intervention-based metrics that measure how visual observations, instructions, and visual memory causally influence navigation decisions. Our results show that these navigation policies are sensitive to all input modalities and do not depend on a single one. We further show that these agents encode navigation progress and retain semantic structure from their VLM backbones, enabling concept-level steering through internal activations. Finally, we extract activation vectors for abstract behaviors to transfer them zero-shot to out-of-distribution real-world scenarios, improving performance without additional fine-tuning.

arXiv ID: 2609.24576 / 要約の誤りについて