視覚言語モデルが何を重視して答えるかを診断する
DiaVLo: Diagnosing Behaviours of Vision-Language Models
この論文をやさしく読む
ひとことで言うと
画像と言語を扱うモデルについて、期待した振る舞いと実際の振る舞いを言葉で整理し、どの概念が答えを左右するかを診断する方法です。
何に役立つ?
精度の数字だけでは分からない誤り方や優先の偏りを点検する用途が考えられます。分類と文章生成の両方で診断ラベルを評価しています。
この研究の面白いところ
人の整理作業とモデルの生成能力を組み合わせ、望ましい振る舞いとの差を明示します。性能とラベルの相関に加え、影響する概念の因果的推定も扱います。
どこまで分かった?
評価対象は複数の公開VLMですが、要旨には具体的な性能値や因果推定の詳細はありません。診断によって不整合を見つけることと、それを修正したり安全性を保証したりすることは別です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚言語モデル(VLM)は、その下位構成要素の間で適切な情報を保持し伝達することに依存する。VLMが有害な振る舞いを避けながら望ましい振る舞いを示すか確かめることは、信頼できる導入の中心的な課題である。しかし、VLMの振る舞いを特定する方法は依然として少ない。 本研究では、人による選別・整理とVLMの生成能力を活用し、望ましい振る舞いと観察された振る舞いの仕様を構築して、潜在的な不整合を明らかにする診断枠組みDiaVLoを提示する。さらにDiaVLoは、VLMの振る舞いを方向付ける上で最も影響の強い概念を特定するための因果的推定も提供する。 複数のオープンソースVLMについて、分類と生成の両条件でDiaVLoを評価する。実験では、DiaVLoがモデル性能と相関する振る舞いラベルを生成し、測定された性能に文脈を与えることを示す。DiaVLoは、明らかに整合的な振る舞いと不整合な振る舞いに加え、VLMが概念をどのように知覚、整理、優先するかというパターンを明らかにした。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Vision-language models (VLMs) rely on storing and transferring appropriate information across their sub-components. Verifying that the VLMs exhibit desired behaviours, while avoiding harmful ones, is central to their reliable deployment. Yet, methods that identify VLM behaviours remain scarce. We present DiaVLo, a diagnostic framework that leverages human curation and VLMs' generation capabilities to construct specifications of desired and observed VLM behaviours, surfacing potential misalignments. Beyond this, DiaVLo also provides causal estimates to identify the most influential concepts steering VLM behaviours. We evaluate DiaVLo on several open-source VLMs under both classification and generation conditions. Our experiments show that DiaVLo produces behaviour labels that correlate with model performance and provide context for measured performance. DiaVLo surfaced behaviours that are clearly aligned and misaligned, alongside patterns in how VLMs perceive, organise, and prioritise concepts.
著者のコメント
34 pages. To appear in EMNLP 2026 (findings)
arXiv ID: 2609.22008 / 要約の誤りについて