大規模な深層学習に使える準ニュートン法
SoftServe: A Scalable Quasi-Newton Method for Deep Learning
この論文をやさしく読む
ひとことで言うと
損失関数の曲がり方を近似して学習を進める準ニュートン法を、非凸で大規模なニューラルネットワーク向けに設計した研究です。
何に役立つ?
方向によって学習の進みやすさが大きく異なる問題の最適化に役立つ可能性があります。物理情報付きモデルやリカレントネットワークなどで損失の改善が報告されています。
この研究の面白いところ
負の曲率がある問題でも正定値の近似を導き、対角・クロネッカー型の構成とGPU向け行列積で計算します。直線探索を使わない設計も特徴です。
どこまで分かった?
要旨はベースラインより低損失となることが多いと述べており、全課題での優越を主張していません。損失の改善量、所要時間、メモリ使用量の具体値はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
準ニュートン(QN)法は、大規模な制約なし凸最適化で、長く特に有効な手法の一つであり続けてきた。深層学習への利用を制限してきた障害は、非凸性と膨大なパラメータ数の2つである。私たちは、直線探索や場当たり的な曲率補正を使わずに、これらの障害を克服するよう設計した準ニュートン法の系列SoftServeを提案する。 SoftServeは、負の曲率がある場合でも、Berglundら(2025)の変分目的関数から正定値の曲率推定を導く。構成上正定値性を保ち、大規模なニューラルネットワークに拡張できる、対角版とクロネッカー分解版を開発する。さらに、必要な行列演算には安定な連立Newton–Schulz反復を用い、コストの高い行列分解を、GPUに適した行列積で置き換える。SoftServeは、リカレントネットワーク、深いオートエンコーダー、物理情報を組み込んだニューラルネットワーク、1億3600万パラメータの物理情報付き拡散モデルなど、条件数が極めて悪い問題で優れた性能を発揮し、Adam、Muon、SOAPを含む確立されたベースラインより低い損失を達成することが多い。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Quasi-Newton (QN) methods have long been among the most effective methods for large-scale unconstrained convex optimization. Two obstacles have limited their use in deep learning: non-convexity and enormous parameter sizes. We introduce SoftServe, a family of QN methods designed to overcome these obstacles without line searches or ad hoc curvature corrections. SoftServe derives positivedefinite curvature estimates from the variational objective of Berglund et al. (2025), even in the presence of negative curvature. We develop diagonal and Kroneckerfactored variants that preserve positive definiteness by construction and scale to massive neural networks. Finally, SoftServe relies on the stable coupled Newton-Schulz iteration for the required matrix operations, replacing costly matrix decompositions with GPU-friendly matrix multiplications. SoftServe excels on problems that are severely ill-conditioned, including tasks such as recurrent networks, deep autoencoders, physics-informed neural networks, and a 136M-parameter physics-informed diffusion model, often achieving lower losses than established baselines including Adam, Muon, and SOAP.
arXiv ID: 2610.02182 / 要約の誤りについて