視覚言語モデルの量子化で総合点に隠れる画像との対応誤りを調べる
GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS
この論文をやさしく読む
ひとことで言うと
視覚言語モデルを軽量化しても、画像に沿った回答の正しさが総合正答率と同じように保たれるかを調べた研究。
何に役立つ?
量子化した視覚言語モデルを選ぶ際、総合正答率とメモリ使用量に加え、画像との対応誤りや実際の推論時間を評価する指標設計に役立つ。
この研究の面白いところ
六つの量子化モデルのうち五つは総合正答率をほぼ保ったが、設問単位の比較では幻覚に敏感な条件を中心に有意な変化が見つかった。
どこまで分かった?
評価対象は80億パラメータの三系列とFP16、INT8、NF4の条件である。自由生成の監査は生成予算による打ち切りの影響を受け、モデル構造と精度でその程度が違った。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
視覚言語モデル(VLM)の学習後量子化は、通常、課題全体の正答率とメモリ節約量で評価される。しかし、代表的な得点を保っても、回答が画像の内容に根拠を持つ振る舞いまで保たれるとは限らない。本研究はGHOST-Qを提示し、80億パラメータのVLMの三つの系列について、FP16、INT8、NF4という精度をまたぎ、有用性と幻覚に敏感なベンチマークで条件をそろえて評価する。全体の正答率だけを比べるのではなく、FP16と量子化後の予測を設問ごとに対応させ、圧縮によって画像との対応付けの成功と失敗がどう再配分されるかを定量化する。 量子化した六つの変種のうち五つは、MMStarの正答率を±2パーセントポイント以内に保った。一方、対応付けて比較した36の効果のうち10は、偽発見率を補正しても有意で、そのうち九つは幻覚に敏感な条件で見られた。同じA100装置上での性能測定からは、メモリを大幅に減らしても推論の待ち時間が短くなるとは限らないことも分かった。さらに、自由形式で生成させるAMBERの監査では、生成に与えた予算による強い打ち切りが見つかり、その程度はモデル構造と精度によって異なった。これらの結果は、量子化VLMでは全体的な有用性、画像に根拠を置く信頼性、生成の振る舞い、実際の運用効率を併せて評価すべきことを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Post-training quantization of vision--language models (VLMs) is typically assessed through aggregate task accuracy and memory savings, but preserving a headline score does not guarantee preservation of visual grounding behavior. We present GHOST-Q, a cross-precision controlled evaluation of three 8B VLM families under FP16, INT8, and NF4 across utility and hallucination-sensitive benchmarks. Rather than comparing only aggregate accuracy, we pair FP16 and quantized predictions item by-item to quantify how compression redistributes grounding successes and failures. Five of six quantized variants preserve MMStar accuracy within $\pm2$ percentage points, yet 10 of 36 paired effects remain significant after false-discovery-rate correction, nine on hallucination-sensitive conditions. Same-device A100 profiling further demonstrates that substantial memory reduction does not necessarily mean lower inference latency. Finally, an open-ended AMBER audit reveals strong generation budget censoring whose severity varies by architecture and precision. These results show that quantized VLMs should be evaluated jointly for aggregate utility, grounding reliability, generation behavior, and realized deployment efficiency.
著者のコメント
Submitted to IEEE ICASSP 2027, 5 pages
arXiv ID: 2609.29999 / 要約の誤りについて