順位予測の高得点に混じる参照データ共有の影響を測る
When a High Score Is an Illusion: Certifying Genuine versus Repackaged Forecasting Skill
この論文をやさしく読む
ひとことで言うと
予測の順位を評価するときに同じ比較用データを使い回すと、予測能力以外の理由で高い関連が出ることを数式とデータで調べています。
何に役立つ?
ベースラインとの差を使う順位評価で、実際の予測能力と参照データの共有による見かけの効果を切り分けるために役立ちます。
この研究の面白いところ
偏りを注意点として挙げるだけでなく、参照の重複が作る相互作用を明示し、それを除くための必要十分条件と推定法を与えています。
どこまで分かった?
91.4~94.5%は北京アーカイブの経験分布における指定の共有スコアの内訳です。一般的な予測精度の何割が無効という意味ではありません。独立した学習と軌跡間の独立性も理論の条件です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
順位は、比較に用いる観測に依存する。評価対象の予測と結果が固定されていても、その観測を再利用することで、予測側と結果側の順位差の間に関連が加わり得る。本研究では、指定された母集団順位の差の間の関連を保つ割当てを特徴づける。これには、予測順位からベースライン順位を引いた差と、結果順位からベースライン順位を引いた差との比較も含む。 独立した学習を条件として、軌跡全体を共通の法則から独立に標本抽出し、各軌跡内の依存関係は制限しない。スコアの期待値は、目標とする量と、写像の対の間の明示的な相互作用に分離される。参照を再割当てするときには、学習済み写像、参照の確率法則、係数の行和を固定する。許容されるすべての写像と法則について一様に関連を保つための必要十分条件は、各写像対で重み付きの参照重複がゼロになることである。 三つの軌跡を使う不偏カーネルで相互作用を推定し、独立した評価と検証によって有限標本の下界を得る。すべての標本を再結合できる場合は、完全U統計量が同じ目標量を直接推定する。同順位も含む、共通ベースラインに関する鋭い範囲の評価によって、両方の構成をさらに精密化する。 北京の大気質アーカイブでは、経験的なアーカイブ分布の下で、学習した七つの予測の共有スコアの期待値の91.4~94.5%が相互作用で説明される。別の結果では、カテゴリ当てはめ誤差と時間的フィードバックを扱う。対応をそろえたカテゴリ対照の帰無実験では、異なる参照を使うと、1,000パネル中の棄却が402から41へ減少する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Ranks depend on the observations used for comparison. Reusing those observations can add association between forecast and outcome rank contrasts even when the evaluated forecast and outcome stay fixed. We characterize assignments that preserve association between specified population-rank contrasts, including forecast rank minus baseline rank compared with outcome rank minus baseline rank. Conditional on independent training, whole trajectories are sampled independently from a common law, with unrestricted dependence within each trajectory. The expected score separates into its target and an explicit interaction between map pairs. When reassigning references, we keep the learned maps, reference law and coefficient row sums fixed. Zero weighted reference overlap for every map pair is necessary and sufficient for preservation uniformly over permitted maps and laws. An unbiased three-trajectory kernel estimates the interaction; independent evaluation and validation provide finite-sample lower bounds. Complete U-statistics estimate the same target directly when all draws can be recombined. Sharp shared-baseline ranges, including ties, tighten both constructions. In a Beijing air-quality archive, interaction accounts for 91.4% to 94.5% of seven learned forecasts' expected shared scores under the empirical archive law. Separate results address category-fitting error and temporal feedback. In a matched category-control null experiment, distinct references reduce rejections from 402 to 41 out of 1,000 panels.
著者のコメント
Accepted by IEEE ICDM'26
arXiv ID: 2609.19223 / 要約の誤りについて