推論を促す指示で画像言語モデルの選択肢採点が崩れる
Reasoning Instructions Can Break Answer Decoding in Vision--Language Models
この論文をやさしく読む
ひとことで言うと
画像と言葉を扱うモデルに「考えてから答えて」と促しながら、考える前の解答確率を読むと評価が崩れる研究です。
何に役立つ?
VLMの選択肢式ベンチマークで、推論指示と採点のタイミングを一致させるための注意点になります。
この研究の面白いところ
ScienceQAでは正解率が80.76%から45.48%へ落ちましたが、隠れ状態には答えの情報が残り、別の読み出し方では多くを回復しました。
どこまで分かった?
影響はデータセットとモデルによって異なり、普遍的ではありません。結果は特定のCoT接頭辞による採点法についてです。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
思考の連鎖(CoT)を促す指示は、採点器が推論を促す文言を付け加えながら、モデルが理由を生成する前に解答ラベルの出力確率を読む場合、画像言語モデル(VLM)の選択肢式評価をゆがめ得る。著者らはこれをCoT接頭辞による採点と呼ぶ。ScienceQAでは、Qwen2.5-VL-7Bの正解率が80.76%から45.48%へ下がり、選択肢の内容を5通りに並べ替えた評価では、この採点法による予測の93.54%が最初の位置を選んだ。 同じ条件の隠れ状態に線形プローブを当てると正解率78.94%を回復でき、自由に文章を生成させると75.24%に戻った。これは、接頭辞の後でも答えの情報が残っていることが多く、直後の読み出し方法が失敗していることを示す。語彙と層ごとの診断から、確率の重みは文章の続きとなるトークンへ移る一方、後段の層には線形的に読み出せる解答情報が残ると分かった。この影響はデータセットやモデルによって程度を変えて再現したが、普遍的ではなかった。CoT接頭辞による採点は、モデルの知識と評価インターフェースの不一致を混同し得るため、要求する出力と採点する出力の時点が一致しない限り、避けるべきだと結論付ける。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Chain-of-thought (CoT) instructions can distort multiple-choice VLM evaluation when a scorer appends a reasoning cue but reads answer-label logits before the model generates any rationale. We call this CoT-prefix scoring. On ScienceQA, Qwen2.5-VL-7B drops from 80.76% to 45.48%, and across five option-content permutations 93.54% of CoT-prefix predictions select the first slot. Condition-matched linear probes recover 78.94% from the same hidden states, while free generation restores 75.24%, showing that the answer often survives the prefix and the immediate readout fails. Vocabulary and layer diagnostics explain the mismatch: probability mass moves toward continuation tokens, while answer information remains linearly accessible in late layers. The effect recurs with varying severity across datasets and models, though not universally. These results show that CoT-prefix scoring can confound model knowledge with an evaluation-interface mismatch and should be avoided unless the requested and scored output events are aligned.
arXiv ID: 2609.29278 / 要約の誤りについて