因果推定用の表モデルに標本変動を学習させる
Learning to Fluctuate: Statistical Foundations for Causal Tabular Pretraining
この論文をやさしく読む
ひとことで言うと
因果効果を予測する表データモデルに、標本を取り直したときの変動まで学習させる方法を提案した。
何に役立つ?
一度の推論で因果効果を推定するモデルの事前学習方法を検討する際に役立つ。低い予測誤差だけで効果の偏りが消えるとは限らない。
この研究の面白いところ
完全な変動を教師ラベルに入れることの理論的な効果を示し、24条件の実験や効果が変わる条件で既存手法と比較した。
どこまで分かった?
理論は記載された有限層などの設定と、分散推定の精度に関する条件を含む。2つの無作為化研究では、RMSEが低くても過小評価が残ると報告している。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
因果推定用の表データ基盤モデルは、合成したさまざまな仕組みにわたって効果の推定を共通化する。しかし潜在的な効果を教師ラベルにすると、配備先の母集団を固定して繰り返し標本を取ったときの応答を表現するよりも、事後分布を縮める方向の学習が促される。本研究は、変動を教師信号にする事前学習FSPを導入する。各合成表に、平均処置効果と、その効率的な影響関数に基づく変動を加えたラベルを付ける。配備時には学習済みモデルの1回の順伝播だけを用いる。 T_{λ,P}=θ(P)+λP_nψ_Pという経路に沿って、端点での移行を証明する。固定したλ<1では、ラベルの曖昧さが(1−λ)²/nの次数で残る。一方、変動を完全に含めるとガウス型のラベルが観測可能になり、有限の層を持つ因果ラベル予測の最適リスクはn⁻²の次数まで下がる。有限回の事前学習に関する上界は、ラベル、ネットワーク、エピソード抽出、最適化の誤差をまとめる。その抽出誤差の項は、固定した仕組みでのバイアス、平均二乗誤差、分散、ガウス近似、さらに分散を推定する部分が正確な場合には標準化した区間の被覆率を制御する。これを補う下界は、局所的なn⁻¹の平均処置効果リスクと、一般的な有限辞書によるエピソード学習の超過リスクlog N/Mを区別する。 実験では、学習された標本変動への応答を追跡した。学習時に扱った文脈長について、非線形で連続共変量を持つ24条件では、連続行版のFSPはチェックポイント平均のマクロRMSEをS-learnerより7.0%下げ、重なりの弱い12条件すべてで上回った。検証で選んだSummary FSPは、著者らの準備済み単一スレッドのベンチマークで、表1件当たり11.6倍速く配備できた。効果が変化する条件では、条件をそろえたRaw FSPが潜在効果による教師信号に比べ、チェックポイント平均RMSEを54.2%、教師の欠陥を99.0%下げ、公開済みCausalPFN-SのチェックポイントよりRMSEを10.2%下げた。既知の効果を使った半合成試験で被覆率を調べ、2つの無作為化研究の評価では、RMSEが低くても効果の過小評価が残りうることを示した。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-24 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Causal tabular foundation models amortize effect estimation across synthetic mechanisms, but latent-effect supervision rewards posterior shrinkage rather than encoding the repeated-sample response needed in a fixed deployment population. We introduce fluctuation-supervised pretraining (FSP): each synthetic table is labeled by its average treatment effect plus its efficient influence-function fluctuation; deployment remains a frozen forward pass. Along the path $T_{\lambda,P}=\theta(P)+\lambda P_n\psi_P$, we prove an endpoint transition: every fixed $\lambda<1$ retains label ambiguity of order $(1-\lambda)^2/n$, whereas full fluctuation makes the Gaussian label observable and reduces optimal finite-stratum causal label-prediction risk to order $n^{-2}$. A finite-pretraining bound combines label, network, episode-sampling, and optimization errors; its sampling defect controls fixed-mechanism bias, mean squared error, variance, Gaussian approximation, and, with variance-head accuracy, studentized coverage. Complementary lower bounds separate local $n^{-1}$ ATE risk from the $\log N/M$ excess risk of generic finite-dictionary episode learning. Experiments trace the learned sampling response. Across 24 nonlinear continuous-covariate cells at trained context lengths, continuous-row FSP lowers checkpoint-mean macro RMSE by 7.0% versus S-learner and wins all 12 weak-overlap cells; validation-selected Summary FSP deploys $11.6\times$ faster per table in our warm one-thread benchmark. Under effect shift, matched Raw FSP lowers mean-checkpoint RMSE by 54.2% and teacher defect by 99.0% versus latent-effect supervision, and RMSE by 10.2% versus the released CausalPFN-S checkpoint. Known-effect semisynthesis tests coverage; two randomized-study evaluations show that lower RMSE can coexist with residual attenuation.
著者のコメント
56 pages, 22 figures. Revised manuscript with expanded experiments, comparator suite, and reproducibility documentation; theoretical conclusions unchanged
arXiv ID: 2609.26290 / 要約の誤りについて