arXiv論文メモ
新着一覧
cs.CV / cs.AI · 査読状況未確認

画像の根拠に注目する注意ヘッドを選んで推論を改善

Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

Jiaqi Deng, Zonghan Wu, Zhan Heng, Xiaoshui Huang, Huan Huo, Guandong Xu

この論文をやさしく読む

ひとことで言うと

画像を見て答えるモデルで、根拠となる領域に注目する注意ヘッドだけを訓練する方法です。

何に役立つ?

画像の根拠を使った推論を改善する用途が考えられます。要旨では六つの評価群で平均3%、最大11.3%のゼロショット改善を報告しています。

この研究の面白いところ

全ヘッドを変えるのではなく、画像への対応付けに反応する3~15%のヘッドだけを、セグメンテーションを手がかりに誘導します。

どこまで分かった?

示された改善は記載された評価群とモデルでの結果です。幻覚が全面的に解消したとは要旨に記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

マルチモーダル大規模言語モデルは画像を使った推論で高い性能を示すが、幻覚や言語上の先入観への過度な依存が残り、課題に関係する画像の根拠を十分使わずに回答することがある。既存の手法は主に推論過程の教師信号や推論時の戦略で改善を図る。本研究は、推論過程を直接教えることなく、暗黙の画像との対応付けを強めれば推論を改善できるか調べる。注意ヘッドの機能分化に着目し、画像の根拠に最も反応するヘッドだけを誘導する。 提案するSelect​​ive Probability Mass Concentration(sPMC)は、画像への対応付けに反応するヘッドを見つけ、そのテキストから画像への注意を選択的に正則化する訓練法である。画像トークン上の正規化された注意を空間的な確率分布として扱い、セグメンテーションから得た空間的な事前情報で、意味的に関係する領域に確率質量を割り当てるよう促す。Adaptive Head Selectionは、視覚に反応するヘッドだけにこの誘導を制限し、残りのヘッドの補完的な機能を保つため制約しない。六つのマルチモーダルなベンチマーク群で、複数のモデルにわたり、注意ヘッドの3~15%だけを正則化して、ゼロショット性能を平均3%、最大11.3%改善した。この結果は、少数の暗黙的な画像根拠への経路を狙って誘導すると、マルチモーダル推論を直接改善できることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multimodal large language models (MLLMs) achieve strong performance on visual reasoning tasks, yet remain prone to hallucinations and over-reliance on language priors, often generating answers without adequately using task-relevant visual evidence. Existing approaches primarily improve reasoning through reasoning-oriented supervision or inference-time strategies. In this work, we study a complementary question: can multimodal reasoning be improved by strengthening implicit visual grounding without directly supervising the reasoning process? Motivated by the functional specialization of attention heads, we investigate whether reasoning can be improved by guiding only the heads most responsive to visual evidence grounding. We propose Selective Probability Mass Concentration (sPMC), a training framework that identifies grounding-responsive heads and selectively regularizes their text-to-image attention. sPMC treats normalized attention over visual tokens as a spatial probability distribution and encourages the probability mass to be assigned to semantically relevant regions using segmentation-derived spatial priors. Adaptive Head Selection restricts this guidance to visually responsive heads while leaving the remaining heads unconstrained to preserve their complementary functions. Across 6 multimodal benchmark suites, sPMC achieves an average zero-shot improvement of 3% and gains of up to 11.3% across multiple MLLMs while regularizing only 3%-15% of their attention heads. These results demonstrate that targeted guidance of sparse and implicit visual evidence pathways can directly improve multimodal reasoning.

arXiv ID: 2609.29940 / 要約の誤りについて