言語モデルの選択肢尤度と回答生成は同じ尺度で伸びない
Likelihood Ranking doesn't Scale Like Prompting in LLMs
この論文をやさしく読む
ひとことで言うと
多肢選択問題で、平叙文の尤度を比べる評価と、回答を生成させる評価の違いを調べた。
何に役立つ?
言語モデルの評価指標を選ぶとき、尤度と回答生成を混同しないための材料になる。
この研究の面白いところ
95モデル・10データセットで、生成による正答率は規模と指示学習で伸びる一方、平叙文尤度の正答率は比較的安定していた。
どこまで分かった?
結果は調べたデコーダー型モデルと多肢選択データセットに基づく。二つの指標が一般に全く無関係という主張ではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデルは通常、質問に対する回答を生成させるか、候補出力の尤度で採点して評価する。ただし多肢選択問題で標準的に使う尤度の採点も質問と選択肢の集合を条件にしており、回答生成と同じ課題に合わせた選択の形式を利用できる。著者らは同じ質問と答えの組から作る平叙文の尤度を順位付けする、別の評価手順を調べる。0.1Bから104Bパラメーターまでのデコーダー型モデル95種類と、多肢選択質問応答のデータセット10種類で、平叙文の尤度順位と指示による回答生成が体系的にずれると分かった。平叙文の尤度による正答率は規模が増えても比較的安定している一方、回答生成は規模の拡大と指示チューニングによって急激に改善した。この結果は、制御された平叙文の候補間の尤度の好みと、課題を条件にした回答選択がモデルの別の側面を測っており、同じものとして扱うべきでないことを示唆する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLM evaluation is commonly performed either by prompting models to produce answers or by scoring candidate outputs with likelihood-based metrics. In multiple-choice QA, however, standard likelihood-based scoring is still conditioned on the question and answer set, and can therefore leverage the same task-conditioned answer-selection interface used in prompting. We study a complementary protocol based on likelihood ranking of declarative statements constructed from the same question--answer pairs. Across 95 decoder-only models, ranging from 0.1B to 104B parameters, and 10 MCQA datasets, we find a systematic divergence between declarative-statement likelihood ranking and prompted answering. Statement-likelihood accuracy remains comparatively stable across scale, whereas prompted answering improves sharply with scale and instruction-tuning. These results suggest that likelihood preferences over controlled declarative alternatives and task-conditioned answer selection probe distinct aspects of model behavior, and should not be treated as interchangeable.
arXiv ID: 2609.29390 / 要約の誤りについて