arXiv論文メモ
新着一覧
stat.ML / cs.LG · 査読状況未確認

同じデータで特徴を選び予測する際の複雑さを解析

Brownian Heads for Deep ReLU Representations: Activation Mass and the Cost of Same-Sample Selection

Mahdi Mohammadigohari and Nicole Mücke

この論文をやさしく読む

ひとことで言うと

学習データを使って特徴を選んだ後、その特徴が最初から決まっていたかのように扱うと、学習の自由度を過小評価することがあります。その差を、特定のReLUネットワークと予測器の組み合わせで数理的に調べています。

何に役立つ?

特徴の大きさによる影響と、候補から特徴を選べることによる影響を分けて、モデルの複雑さを評価するための理論です。

この研究の面白いところ

隠れベクトルの平均ノルムが同じでも、同じ標本で特徴を選ぶかどうかによって差が残ることを示しています。特徴の規模だけでは捉えられない選択の効果を扱う点が中心です。

どこまで分かった?

解析対象は、指定されたRKHSのノルム有界な予測器を接続したReLU表現です。レートの一致には入力が相互に異なるという条件などがあり、あらゆる深層学習モデルの性能保証を述べた結果ではありません。実験の具体的な予測精度は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

深い表現学習では、同じ標本を使って隠れ特徴を選び、最終的な予測器を当てはめることが多い。そのため、特徴選択後に特徴が固定されているとして解析すると、選択に伴うコストを見落とすことがある。本研究では、深いReLU表現に、加法型またはレヴィ=ブラウン型の再生核ヒルベルト空間(RKHS)に属するノルムが有界な予測器を接続したときの、条件付き経験ラデマッハ複雑度を調べる。この予測器をブラウン型ヘッドと呼ぶ。 表現が固定されている場合には、正確な双対恒等式と鋭い評価を導き、それを観測された隠れベクトルのノルムの平均である活性化質量によって表す。同一標本上で表現を選択する場合には、表現全体について上限を取ることで二次のラデマッハ過程が生じる。ブラウン型のレイヤーケーキ恒等式とガウス射影恒等式を用いて、これを座標ごと、または符号付き射影のしきい値トレースへ帰着させ、実現されたスケールと選択の複雑さを分離する。 入力が相互に異なる標本については、明示的なスカラーReLU族が、実現されたトレースと包絡の水準で、普遍定数の違いを除いて有限トレースおよびVCのレートに一致する。また、誘導ノルムの縮小性から、矩形かつ階数が不足したReLUネットワークに対するアーキテクチャ水準の評価も得られる。実験では、これらの鋭い評価とレートを検証し、活性化質量を固定しても選択に伴う差が生じることを示すとともに、ブラウン型ヘッドを予測に利用できるかを評価する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Deep representation learning often selects hidden features and fits the final predictor on the same sample, so fixed-feature analysis performed after selection can omit selection cost. We study the conditional empirical Rademacher complexity of deep ReLU representations followed by bounded-norm predictors in additive or Lévy-Brownian RKHSs, termed Brownian heads. For a fixed representation, we derive an exact dual identity and sharp bounds in terms of activation mass, the average norm of the observed hidden vectors. Under same-sample selection, the representation supremum induces a quadratic Rademacher process. Brownian layer-cake and Gaussian-projection identities reduce it to coordinatewise or signed projected threshold traces, separating realized scale from selection complexity. For samples with pairwise-distinct inputs, explicit scalar ReLU families match the finite-trace and VC rates up to universal constants at the realized trace-and-envelope level. Induced-norm contraction also yields architecture-level bounds for rectangular, rank-deficient ReLU networks. Experiments verify the sharp bounds and rates, exhibit a selection gap at fixed activation mass, and assess the predictive feasibility of Brownian heads.

arXiv ID: 2609.21422 / 要約の誤りについて