arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

候補モデルの採用を統計的な証拠で制御するEGR

Evidence-Gated Research: Statistically Controlled Model Adoption in Adaptive Search

Yifan Guo

この論文をやさしく読む

ひとことで言うと

モデルを繰り返し改良する過程で、次の候補を採用する判断そのものに統計的な条件を課し、根拠の弱い置き換えを抑える方法です。

何に役立つ?

候補を採用すると次の探索方向も変わる開発で、誤った採用の割合を管理するために役立ちます。複数環境での目標を事前に決めて証拠を集める設計です。

この研究の面白いところ

一回の性能比較だけでなく、採用が将来の候補を変える連鎖まで統計的制御の対象にします。証拠をまだ判断がつかない部分へ配分することで、評価の負担も減らします。

どこまで分かった?

偽発見率の保証には条件付き妥当性と予測可能性の条件があります。5,000軌道で誤採用の経路が観測されなかったことは、誤採用確率がゼロである証明ではありません。56.1%の削減は指定の再実行比較と代表的なしきい値での結果です。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

適応的なモデル探索は経路に依存する。挑戦者となる候補が採用されると、それが後の候補を生成する基準になる。そのため、統計的な裏付けのない置き換えは、まだ提案されていない仮説まで変えてしまう可能性がある。 本研究では、現行モデルが入れ替わる探索のための統計的な採用判定層、Evidence-Gated Research(EGR)を導入する。EGRは、判断用の証拠を明かす前に各候補を固定し、事前に宣言した環境の集合にわたって、任意の時点で有効な証拠を構築する。まだ解決していない構成要素へ予測可能な仕方で証拠を割り当て、候補について持続的に保持するe値を合成し、そのe値をオンライン制御器へ渡す。明示的な条件付き妥当性と予測可能性の条件の下で、この手順は、以前の採用が後の候補を変える場合でも、宣言した全環境での採用目標に対する偽発見率を制御する。 5,000軌道の閉ループベンチマークでは、開発用情報だけを用いるe-LONDの持続的なFDRが0.621となった一方、監査したEGRの各変種では、その有限回の実行中に、持続的な誤採用の経路は観測されなかった。600組の候補・現行モデルの対応をそろえた再実行比較では、Stagewise EGRは、代表的なしきい値において判断用の証拠を56.1%少なくしながら、固定された任意時点有効の比較手法と同じ対立仮説側のしきい値通過判定を維持した。三つの環境からなる公開データの研究と、40,000サンプルを用いた制御されたニューラルモデルのベンチマークでも、証拠の利用効率が向上する傾向を再現した。これらの結果は、モデルの置き換え自体が、適応的なモデル開発における独立した統計的制御点であることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Adaptive model search is path dependent: once a challenger is adopted, it becomes the reference from which later candidates are generated. A statistically unsupported replacement can therefore alter hypotheses that have not yet been proposed. We introduce Evidence-Gated Research (EGR), a statistical adoption layer for moving-incumbent search. EGR freezes each challenger before decision evidence is revealed, builds anytime-valid evidence across a predeclared set of environments, routes evidence predictably toward unresolved components, composes a persistent candidate e-value, and passes that e-value to an online controller. Under explicit conditional-validity and predictability conditions, the resulting procedure controls false discovery rate for the declared all-environment adoption target even though earlier adoptions change later challengers. In a 5,000-trajectory closed-loop benchmark, development-only e-LOND attains persistent FDR 0.621, whereas no persistent false-adoption path is observed for the audited EGR variants in that finite run. In matched replay over 600 challenger--incumbent pairs, Stagewise EGR preserves fixed-anytime alternative crossing decisions while using 56.1% less decision evidence at the representative threshold. A three-environment public-data study and a 40,000-sample controlled neural benchmark reproduce the evidence-efficiency pattern. These results identify model replacement as a distinct statistical control point in adaptive model development.

著者のコメント

17 pages, 4 figures. Preprint

arXiv ID: 2610.01751 / 要約の誤りについて