新しい文章の圧縮率で言語モデルを評価する
Uncheatable Eval: Dynamic Compression-Based Evaluation of Language Models
この論文をやさしく読む
ひとことで言うと
新しく公開された文章をモデルがどれだけ無損失圧縮できるかで、言語モデルの予測能力を評価する方法。
何に役立つ?
学習データの混入が評価をゆがめる可能性を減らし、指示追従が弱いベースモデルも比較する手段になる。
この研究の面白いところ
文章の圧縮率が、別の知識評価であるゼロショットMMLUの正答率とも強く関係した。
どこまで分かった?
要旨で示された評価は80モデルと14分野の文章に基づく。新着文章を使っても、全てのデータ混入を完全に防げるとは示していない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
現在の大規模言語モデルは大量のデータで事前学習されるため、評価用データが学習集合に入り込むのを防ぐのが難しく、評価結果の信頼性を損なう。指示に従う能力が限られるベースモデルでは、課題を使った評価がさらに難しい。本研究は、新たに公開された文章を定期的に集めてベース言語モデルを評価し、データ混入のリスクを減らす動的ベンチマークUncheatable Evalを導入する。モデルの予測能力と無損失でデータを圧縮する能力の関係を利用し、圧縮率によって新しい文章をどれだけよく予測できるかを評価する。 14種類の文章分野にわたる80モデルを評価し、文脈長に伴う圧縮の変化と、圧縮率とゼロショットMMLU正答率の相関を調べた。結果から主に三点が分かった。第一に、圧縮性能はモデル規模に対して一貫した拡大傾向を示す。第二に、注意機構型、混合型、再帰型のモデルでは、利用できる文脈が増えたときの圧縮性能の変化が異なる。第三に、圧縮率が低いほどゼロショットMMLU正答率が高い傾向が強い。コードは公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Modern large language models are pretrained on massive datasets, making it difficult to prevent benchmark data from entering their training sets and undermining the reliability of evaluation results. Reliable evaluation is particularly challenging for base models, whose limited instruction-following ability complicates task-based assessment. We introduce Uncheatable Eval, a dynamic benchmark that regularly collects newly published text to evaluate base language models and reduce the risk of data contamination. Drawing on the relationship between a model's predictive ability and its ability to compress data losslessly, we use compression rate to evaluate how well models predict new text. We evaluate 80 models across 14 text categories, study how compression changes with context length, and examine the correlation between compression rate and zero-shot MMLU accuracy. Our results yield three main findings: (1) compression performance follows a consistent scaling trend with model size; (2) attention-based, hybrid, and recurrent models differ in how their compression performance changes as more context becomes available; and (3) lower compression rates are strongly associated with higher zero-shot MMLU accuracy. Code is available at https://github.com/Jellyfish042/uncheatable_eval.
著者のコメント
17 pages, 7 figures
arXiv ID: 2609.27510 / 要約の誤りについて