表形式データの文脈内学習で表現をその場で更新
What Do Tabular Foundation Models Compute In Context? In-Situ Representation Refinement through Attention-Gated Updates
この論文をやさしく読む
ひとことで言うと
支援例のラベルで文脈中の表現を更新し、表ごとの予測器を作るモデル。
何に役立つ?
考えられる用途は、表形式データの少数例学習で、モデルの再学習なしに新しい表へ適応することである。
この研究の面白いところ
中間表現への介入を行い、支援例の更新が実際に予測へ効いていることを調べる。
どこまで分かった?
複数ベンチマークでの成績を報告する。継続学習版など評価設定に依存し、全表での優位は要旨にない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
表ごとに新しい教師あり課題が生じるとき、表形式データの基盤モデルはどのような再利用可能な計算を学ぶべきかを考える。本研究は「その場での表現の改良」を開発する。支援例のラベルが、その課題中の表現の更新を導き、その更新をモデルのパラメータを変えずにラベルなしの問い合わせへ移す。正則化した一例抜きの目的関数から、支援例の補正と問い合わせへの拡張を導く。主要項は注意による読み出しと状態に依存する尺度調整を分け、これをもとにRefineICLを提案する。これは、注意で制御され、フィードフォワードネットワークを持たない文脈処理層に、選択的な低ランク特徴相互作用と型付き記憶を組み合わせる。RefineICL-L24はAMLB29でOVR-AUC 0.93836、正解率0.87173を達成した。ベンチマークの情報を踏まえた継続学習版は、38データセットのTabArenaの時点別評価で1644.8 Eloに達し、同じ条件のTabPFN-3を31.4 Elo上回った。またTabZillaの二つの評価でも、報告された四指標すべてでTabPFN-v3を改善した。同じ10万回の更新で深さをそろえた比較では、拡張したフィードフォワードネットワークは検証性能に一貫した利点がなく、L8では推論時の最大メモリを60.2%多く使った。内部への介入では、支援例の表現はラベルの静的な供給源以上の役割を持つことが分かった。問い合わせ出力を保ったまま中間の支援例更新を一つ除くと、試した72課題すべてで最終的な問い合わせの交差エントロピーが増えた。導出と介入の両方により、注意で制御された更新が文脈中に課題固有の予測器を作る仕組みを説明する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
What reusable computation should a tabular foundation model learn when every table defines a new supervised task? We develop in-situ representation refinement: support labels guide updates to the episode's representations, and these updates transfer to unlabeled queries without changing model parameters. A regularized leave-one-out objective yields a support correction and its query extension. The leading term separates attention-based reading from state-dependent scaling, motivating RefineICL: an attention-gated, FFN-free contextual stack with selected low-rank feature interaction and typed memory. RefineICL-L24 reaches 0.93836 OVR-AUC and 0.87173 accuracy on AMLB29. A benchmark-informed continuation reaches 1644.8 Elo on the 38-dataset TabArena snapshot, 31.4 Elo above TabPFN-3 under the same evaluation. It also improves all four reported metrics over TabPFN-v3 on both TabZilla views. In a matched 100K-update depth grid, an expanded FFN gives no consistent validation benefit and uses 60.2% more peak inference memory at L8. Internal interventions show that support representations are more than a static source of labels: removing one intermediate support update, while preserving the query output, increases final query cross-entropy in all 72 tested episodes. Together, the derivation and interventions explain how attention-gated updates can construct a task-specific predictor in context.
arXiv ID: 2609.27679 / 要約の誤りについて