画像の分割や配置が視覚言語モデルの回答を誤らせる
Reading Right, Answering Wrong: How Visual Configuration Changes Affect Evidence Use in VLMs
この論文をやさしく読む
ひとことで言うと
画像を少し縮小・拡大すると答えを読めるまま誤答する場合があり、画像の分割や配置の切り替わりが関係することを調べた研究。
何に役立つ?
視覚言語モデルの画像入力を設計し、文字や証拠を読めるのに回答に使えない失敗を調べる際に役立つ。
この研究の面白いところ
誤答例の半数超では正解を読む能力が残り、注釈補助を伴う誘導で該当する誤答の97.2%を修正した。
どこまで分かった?
97.2%は読み取れる情報がある誤答に対し、注釈の補助を使った条件での値である。すべての誤答の自動修正率ではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚言語モデル(VLM)は画像に関する質問応答などで高い性能を示すが、画像をわずかに拡大・縮小するだけで正しい回答が誤答に変わることがある。本研究は、画像のタイル分割やトークン配置などの視覚的構成の変化が、この不安定さに関係するかを調べる。七つのモデルの保存時点と四つのベンチマークでは、同じ程度の小さな画像サイズ変更でも、構成が切り替わる場合に正誤の反転がより多く起きた。意外なことに、そのような場合の半数超で、モデルは質問への回答を誤る一方、読む場所を指示されると正しい答えを読み取ることができた。さらにLLaVA-NeXTへの注意機構の介入から、構成の変化は、読み取れる情報を回答に利用する過程を弱め得ることが示唆された。そこで、情報のある領域を示す手掛かりと、モデル自身による転記を用いて回答を導いた。注釈作業の補助を得た場合、この二つの誘導を合わせることで、読み取れる情報がある誤答の97.2%を修正した。結果は、視覚的構成の変更が、モデルが依然として読める情報の使い方に影響することを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Vision-language models (VLMs) have achieved strong performance on tasks such as visual question answering, yet small image resizes can turn correct answers into errors. We investigate whether changes in visual configuration, such as image tiling and token arrangement, contribute to this instability. Across seven checkpoints and four benchmarks, equally small resizes cause more correctness flips when they switch configurations. Surprisingly, in over half of these cases, models answer the question incorrectly but can still read the correct answer when told what to read. Furthermore, attention interventions in LLaVA-NeXT suggest that configuration changes can weaken the use of readable information during answering. We therefore guide models using field cues and their own transcriptions. With annotation assistance, these forms of guidance together correct 97.2% of errors with readable information. These findings show that configuration changes can affect how models use information they can still read.
著者のコメント
6 pages, 3 figures, and 6 tables. Preprint
arXiv ID: 2609.25770 / 要約の誤りについて