分類木で選んだ集団の差を選択の影響込みで検定する
Selective Inference for CART with Binary Outcomes
この論文をやさしく読む
ひとことで言うと
分類木で差がありそうな集団を選んだあと、その同じデータで差を検定するときの選択の影響を扱う方法です。選ばれ方を条件に含めた検定を構成します。
何に役立つ?
データを使って発見した部分集団の差について、検定の誤検出を適切に扱うための理論と計算方法になります。
この研究の面白いところ
事前に決めた有限の計算予算でもp値の性質を保証する構成を示します。また、計算を増やしても戻らない情報の損失を、計算不足とは分けて考えます。
どこまで分かった?
対象に到達した場合の棄却率51〜71%と、選択から棄却まで至る全データセット中の割合11〜21%は異なります。小さい差の検出は難しく、保証は内部が不均質な領域同士の平均の比較には及びません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
二値分類木は、後に集団間の差を評価する際にも使われる同じ結果変数によって、部分集団を選択する。本研究では、決定論的なジニ基準のCARTで選ばれた親ノード内の成功確率が共通であることを検定する、有限標本での条件付き検定を開発する。この構成は、適格なすべての分割点を保持し、選択された分割、その祖先経路、親ノード内の成功総数、外部の結果に条件付ける。得られるラベル配置の集合上の一様分布から、正確なカウント分布が得られる。一方、可逆な並列モンテカルロ構成は、事前指定した任意の有限の実行予算に対して、同値を含める方式では超一様なp値を、同値をランダム化する方式では厳密に一様なp値を与える。 二つの子ノード内でそれぞれリスクが一定のモデルでは、選択後のカウントの分布は指数型分布族となり、その情報量は条件付きカウント分散に等しい。情報の損失と計算上の制約を切り分け、単一ラベル交換では連結にならない、選択に対応するラベル配置の集合の例を示す。 観測数200または400、独立または相関する10個の予測変数、深さ3の木を用いたシミュレーションでは、同値を含める検定は保守的であり、リスク差が大きい場合には無視できない検出力を持つことが示された。観測数400、データ生成時のリスク差0.4の場合、事前指定した第3階層の対象に到達したことを条件とするランダム化検定の棄却率は51〜71%である。一方、選択されたうえで棄却に至るデータセットは11〜21%であった。より小さい信号の検出は依然として難しく、代表的な例では計算量を5倍にしても検出力はほとんど改善しなかった。保証の対象は親ノード内の均質性、または二つの子ノードでそれぞれ一定のリスクが等しいことであり、内部が不均質な領域間の平均値が等しいことまでは対象にしない。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Binary classification trees select subgroups using the same outcomes later used to assess their differences. We develop finite-sample conditional tests of a common success probability within a parent selected by deterministic Gini CART. The construction retains all eligible cutpoints and conditions on the selected split, its ancestor path, the parent success total, and outside outcomes. The resulting uniform label fiber gives an exact count distribution, while a reversible parallel Monte Carlo construction yields super-uniform inclusive and exactly uniform tie-randomized p-values for any prespecified finite run budget. Within a two-child constant-risk model, the selected count law is an exponential family with information equal to its conditional count variance. We separate information loss from computational limitations and exhibit a selected fiber disconnected under single-label swaps. Simulations with 200 or 400 observations, ten independent or correlated predictors, and trees of depth three show conservative inclusive tests and nontrivial power for large risk differences. At 400 observations and a generating risk difference of 0.4, randomized rejection conditional on reaching the prespecified third-level target is 51--71\%, while selection followed by rejection occurs in 11--21\% of datasets. Smaller signals remain difficult to detect, and a representative fivefold increase in computation gives little power improvement. The guarantee concerns parent homogeneity, or equality of two constant child risks, and does not cover equality of heterogeneous regional averages.
arXiv ID: 2609.24949 / 要約の誤りについて