事前学習した表データ表現で不要な特徴を選別する
PACE: Plug-and-Play Contextual Embedding for Feature Screening with Pretrained Tabular Foundation Models
この論文をやさしく読む
ひとことで言うと
表のどの列を学習に使うか選ぶ前に、事前学習済みモデルで各列の表現を変え、単純な見方では分からない関連を拾いやすくする方法です。
何に役立つ?
列数が多い表データで、不要な特徴を取り除く前処理に使うことが考えられます。選別だけでなく、その後の分類や回帰の指標改善も報告しています。
この研究の面白いところ
ランダムに次元を増やす対照条件も用意し、事前学習した構造が改善に寄与するかを比較しています。エンコーダーを固定したまま既存の採点規則へ追加できます。
どこまで分かった?
AUCの0.077と0.064は指標値の改善量であり、分類正解率が同じ割合だけ上がったという意味ではありません。要旨にはデータセット別の結果や追加計算時間の具体値はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
高次元の表形式データの学習では、特徴スクリーニングが、モデルの当てはめ前に無関係な特徴を除去するための軽量でモデルに依存しない方法となる。しかし、生の値を直接採点すると、非線形の構造や分布の構造を見落とすことがある。本研究ではPACE(Plug-and-Play Contextual Embedding)を導入する。これは、既存の特徴採点規則の前に、固定した表形式基盤モデル(TFM)の列エンコーダーを挿入し、各特徴を文脈を反映した高次元表現へ拡張する手法である。 条件を制御した研究では、PACEは比較的小さな追加エンコードコストで、複雑な非線形依存関係に対する、生の特徴空間でのスクリーニングを改善する。この改善は、TALENTデータセットの後段の予測にもつながる。PACE-DCは、10種類の学習器にわたって、二値分類のAUCを0.077、多クラス分類のマクロAUCを0.064改善し、正規化RMSEの改善量の中央値は0.063となった。条件を揃えたランダム重みとランダム特徴の対照実験は、PACEの改善が単なる次元拡張だけではなく、事前学習された構造によることを示す。さらにPACEは、課題ごとに学習する選択法や寄与度に基づく手法に対して、性能と時間の好ましいトレードオフを達成する。これにより、事前学習された列表現の幾何構造を、表形式学習の上流で再利用できる基本要素として位置付ける。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
In high-dimensional tabular learning, feature screening provides a lightweight, model-agnostic way to remove irrelevant features before model fitting. However, scoring raw values directly can miss nonlinear or distributional structure. We introduce PACE (Plug-and-Play Contextual Embedding), which inserts a frozen tabular foundation model (TFM) column encoder before an existing feature-scoring rule, expanding each feature into a higher-dimensional contextual representation. Across controlled studies, PACE improves raw-space screening of complex nonlinear dependence with only modest additional encoding cost. These gains translate to downstream prediction on TALENT datasets: PACE-DC improves binary AUC by 0.077 and multiclass macro-AUC by 0.064, with a median normalized RMSE improvement of 0.063 across ten learners. Matched random-weight and random-feature controls show that PACE gains from pretrained structure beyond generic dimensional expansion. PACE further achieves favorable performance--time trade-offs against task-fitted selectors and attribution-based methods, positioning pretrained column geometry as a reusable upstream primitive for tabular learning.
arXiv ID: 2609.23574 / 要約の誤りについて