arXiv論文メモ
新着一覧
math.OC · 査読状況未確認

ヘッセ行列を送らず分散確率最適化の通信回数を減らす

Application of Optimal Inexact Second-Order Acceleration to Distributed Stochastic Optimization under Statistical Similarity

Yury A. Sokolov, Maxim K. Mashtaler, Alexander V. Gasnikov, Martin Takáč, Dmitry I. Kamzolov, Artem D. Agafonov

この論文をやさしく読む

ひとことで言うと

複数の計算機にデータを分けた凸最適化で、勾配だけをやり取りしながら、2階の情報を使う加速法の利点を得る研究です。サーバー側の局所ヘッセ行列を全体の近似として利用します。

何に役立つ?

考えられる用途は、計算より通信が負担となる分散学習や統計推定です。要旨で示す改善は必要通信回数の理論評価で、実機の速度測定ではありません。

この研究の面白いところ

局所問題どうしの統計的な類似性を使い、大きなヘッセ行列を送らずに済ませます。適切なワーカー数の条件で、総標本数に対する通信回数の指数を1/6から1/7へ改善しています。

どこまで分かった?

独立標本、凸性、局所ヘッセ行列の統計的類似性を用いた設定で、提案する再始動版は強凸な経験問題を対象とします。Õは対数因子を省いており、任意のデータ分割での保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

固定予算のN個の独立な標本をm個のワーカーに分割する、分散確率凸最適化を考える。標本平均近似により、問題は正則化された有限和問題へ帰着され、その局所ヘッセ行列は統計的に類似する。このため、サーバーにある局所目的関数のヘッセ行列を、大域的な目的関数の不正確なヘッセ行列として用いることができ、ワーカーは勾配だけを通信すればよい。 本研究では、Chenら(2026年)の最適な加速不正確ニュートン外挿勾配法を適用し、強凸な経験問題に対する、再始動を用いた分散版を提案する。この方法は、Õ(max{N^{1/7},m^{1/4}})回の通信ラウンドで、N^{−1/2}のオーダーの統計精度に到達する。したがって、ワーカー数をm=N^{4/7}とすると、必要な通信回数はÕ(N^{1/7})となり、総標本数への依存性が、Agafonovら(2021年)による従来の加速3次ニュートン法の構成でのÕ(N^{1/6})から改善される。各反復では勾配を集約する通信ラウンドを2回用い、ヘッセ行列の通信は必要としない。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We consider distributed stochastic convex optimization with a fixed budget of $N$ independent samples split among $m$ workers. Sample average approximation reduces the problem to a regularized finite-sum problem whose local Hessians are statistically similar. This allows the Hessian of the local objective at the server to be used as an inexact Hessian of the global objective, while the workers communicate only gradients. We apply the optimal accelerated inexact Newton extragradient method of (Chen et al., 2026) and propose its distributed restarted variant for the strongly convex empirical problem. The method reaches the statistical accuracy of order $N^{-1/2}$ in $\widetilde O\left(\max\{N^{1/7},m^{1/4}\}\right)$ communication rounds. Hence, with $m=N^{4/7}$ workers, it requires $\widetilde O\left(N^{1/7}\right)$ rounds, improving the dependence on the total sample size from $\widetilde O\left(N^{1/6}\right)$ for the previous accelerated cubic Newton construction of (Agafonov et al., 2021). Each iteration uses two gradient aggregation rounds and does not require Hessian communication.

arXiv ID: 2609.21878 / 要約の誤りについて