arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

評価課題が訓練に含まれた影響を因果的に測る

Beyond Overlap: Estimating the Causal Effect of Benchmark Exposure

Divyansh Singh

この論文をやさしく読む

ひとことで言うと

評価課題に関する情報への接触がモデルの正答率をどれだけ押し上げるかを、情報へのアクセスを操作して測った。

何に役立つ?

ベンチマーク汚染の有無だけでは判断できない、得点への影響の大きさを評価する方法として役立つ。

この研究の面白いところ

2,048課題群と262,144回の生成を使い、すべてのモデル群と課題領域の組み合わせで7.17〜27.31ポイントの上昇を観測した。

どこまで分かった?

示した効果は本研究で作成した課題、二つのモデル群、二つの領域での測定である。既存のすべてのベンチマークの汚染効果を示す数値ではない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

評価用の材料が訓練に入り込んだ証拠があっても、それが評価結果にどれほど影響したかは分からない。この違いのため、汚染されたベンチマークの得点は解釈しにくい。出所の追跡によって接触の事実は確かめられても、その接触に由来する性能を定量化するには反事実的な比較が必要である。本研究は、この量を推定する介入型の枠組みLeakScaleを提示する。LeakScaleは、公開課題には含まれず、そこから導くこともできない、課題群ごとの非公開情報を必要とする新しい実行可能課題を作る。その情報へのアクセスを制御し、対照条件で補正した実行正答率の変化を推定する。2,048種類の課題群、二つのモデル群、二つの実行可能課題の領域、計262,144回の生成にわたり、情報への接触はモデルと領域のすべての組み合わせで正答率を高め、上昇幅は7.17〜27.31ポイントだった。この結果は、しばしば混同される二つの実証的な問い、すなわちベンチマークへの接触があったか、報告された得点がその接触にどれほど依存するかを分ける。LeakScaleは後者を直接測定可能にする。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Evidence that evaluation material entered training does not reveal how much it affected evaluation. This distinction leaves a contaminated benchmark score difficult to interpret: provenance can establish contact, but only a counterfactual can quantify the performance attributable to that contact. We present LeakScale, an interventional framework for estimating this missing quantity. LeakScale creates fresh executable tasks that require private, family-specific information absent from and non-derivable from the public task, controls access to that information, and estimates the resulting control-adjusted change in executable accuracy. Across 2,048 unique families, two model families, two executable domains, and 262,144 generations, exposure improves accuracy in every model-by-domain combination, with gains ranging from +7.17 to +27.31 percentage points. These findings separate two empirical questions that are often conflated: whether benchmark contact occurred and how strongly a reported score depends on it. LeakScale makes the latter directly measurable.

arXiv ID: 2609.27176 / 要約の誤りについて