arXiv論文メモ
新着一覧
stat.ML / cs.LG / math.ST / stat.TH · 査読状況未確認

学習を止める時刻とニューラルネットの幅をデータから決める

A Smoothed Discrepancy Principle for Random Feature Methods and Neural Networks

Mike Nguyen and Nicole Mücke

この論文をやさしく読む

ひとことで言うと

モデルの大きさと学習の止め時を、未知の関数の滑らかさをあらかじめ知らずにデータから選ぶ理論研究です。カーネル法、ランダム特徴、特定の領域のニューラルネットを結び付けます。

何に役立つ?

精度を保ちながら必要以上に多くの特徴や学習反復を使わないための選択原理になります。幅と停止時刻を別々に手調整する代わりに、統計的保証とともに考えられます。

この研究の面白いところ

早期停止だけでなく、最適な収束率に必要なランダム特徴数も同時に決めます。その関係をニューラルネットの幅へ移す点が特徴です。

どこまで分かった?

滑らかさ全域への適応性には適切に指定された回帰モデルという条件があり、ニューラルネットの議論はニューラル接線カーネル領域に基づきます。一般的な深層学習のあらゆる訓練設定への無条件な保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

古典的なノンパラメトリック回帰の設定で、スペクトル正則化法のデータ駆動型早期停止を研究する。残差原理を基礎として、一般的なカーネル推定器へ適用できる多尺度の停止規則を提案する。従来法と異なり、モデルが適切に指定された場合には、すべての滑らかさの水準に対して完全な適応性を達成することを示す。 本研究の主要な貢献は、ランダム特徴近似に基づく拡張である。これはミニマックス最適な統計的保証を保ちながら、大規模データセットでの計算コストを削減する。提案手順は最適な停止時刻を選ぶだけでなく、最適な収束率を達成するのに必要なランダム特徴の数も、完全にデータ駆動で選択する。ニューラル接線カーネル領域におけるランダム特徴とニューラルネットワークの既知の関係を通じて、ネットワークの幅についても、原理に基づくデータ駆動の推奨を得る。このように幅と停止時刻を同時に選ぶことで、滑らかさや容量のパラメータを事前に知らなくても、ニューラルネットワークがミニマックス最適な学習率を達成できることを証明する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study data-driven early stopping for spectral regularisation methods in the classical non-parametric regression setting. Building on the discrepancy principle, we propose a multi-scale stopping rule that applies to general kernel estimators and show that, unlike previous approaches, it achieves full adaptivity over all smoothness levels in the well-specified case. A key contribution of our work is an extension based on random feature approximations, which reduces computational cost on large datasets while preserving minimax-optimal statistical guarantees. Our procedure not only selects an optimal stopping time but also provides a fully data-driven choice of the number of random features needed to achieve optimal rates. Through the established connection between random features and neural networks in the neural tangent kernel regime, our method further yields a principled, data-driven recommendation for the network width. We prove that the resulting simultaneously chosen width and stopping time allow neural networks to attain minimax-optimal learning rates without prior knowledge of smoothness or capacity parameters.

arXiv ID: 2609.21017 / 要約の誤りについて