LLM順位表の優位性は非公開のモデル選択にどれほど左右されるか
How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?
この論文をやさしく読む
ひとことで言うと
LLM順位表の小さな性能差が、非公開の候補選びを考慮しても統計的に支持されるかを調べた研究です。
何に役立つ?
順位表で隣接するモデルの優劣を評価するとき、非公開候補の数や相関に関する仮定を点検するのに役立ちます。
この研究の面白いところ
394件中391件が候補選択の補正前から裏づけ不足であり、残る主張でも候補間相関の定義によって判断が変わり得ます。
どこまで分かった?
感度曲線は固定した候補群とガウスモデルを前提にします。非公開の探索候補数そのものは推定していません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデルの順位表で示される性能向上は、非公開で評価された複数のモデル候補から選んだ結果かもしれない。しかし、候補数も候補間の依存関係も公表されていない。著者らは、公表された性能差が固定した比較対象に対する提供者の優位性を統計的に裏づけるには、非公開の候補が最大何種類まであり得るかを問う。固定した候補群と性能差のガウスモデルの下で、候補間相関の下限に応じてこの最大数を示す感度曲線を導く。相関は順位付けに使う得点と標本抽出モデルに合致する必要がある。制御された候補群では、項目をまとめた相関は0.90だったが、複合得点の相関は項目の再標本化では0.46、MMLUの科目の再標本化では0.92だった。Open LLM Leaderboardで隣接順位の優位性を主張する394件を項目単位で監査したところ、391件はモデル選択の影響を考慮する前から統計的な裏づけを欠いていた。補正前の検定を通過する主張でも、認定の可否は非公開候補群の相関に関する仮定に左右され得る。得られた曲線は、観測できない探索候補数を推定せずに、こうした仮定を明示する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLM leaderboard gains can reflect selection among privately evaluated model variants, yet neither the number of variants nor their dependence is public. We ask how many hidden variants a published margin can support while retaining statistical evidence of a provider's advantage over a fixed comparator. For a fixed candidate family under a Gaussian margin model, we derive a sensitivity curve that reports this maximum count as a function of a lower bound on within-family correlation. The relevant correlation must match the score used for ranking and the sampling model: in a controlled family, pooled item correlation is 0.90, whereas composite-score correlation is 0.46 under item resampling and 0.92 when MMLU subjects are resampled. An item-based audit of 394 adjacent-rank claims on the Open LLM Leaderboard finds that 391 lack statistical support even before accounting for selection. Among claims that pass the uncorrected test, certification can depend on assumptions about the hidden family's correlation. The resulting curves make these assumptions explicit without estimating the unobserved search size.
著者のコメント
32 pages
arXiv ID: 2609.28177 / 要約の誤りについて