arXiv論文メモ
新着一覧
cs.IR · 査読状況未確認

推薦モデルの学習で初期化や保存の待ち時間を減らす

Optimizing Effective Training Time for Large-Scale Recommendation Systems

Mingming Ding, Ruilin Chen, Yuzhen Huang, Hang Qi, Menglu Yu, San Tan, Damian Reeves, Boris Sarana, Kevin Tang, Satendra Gera, Gagan Jain, Sahil Shah, Vishwa Karia, Fuzail Khan, Yashasvi Makin, Edward Z. Yang, Oguz Ulgen, Jia Chen Ren, Laith Sakka, Mayank Garg, Meet Vadakkanchery, Aici Lin, Wei Sun, Mengjiao Zhou, Shuai Yang, Junqing Zhou, Max Leung, Apoorv Purwar, Musharaf Sultan, John Bocharov, Zhenyu Tang, Vivek Trehan

この論文をやさしく読む

ひとことで言うと

GPUを使っている時間のうち、実際に新しいデータを学習している割合を増やす研究です。初期化、コンパイル、保存、復旧などで失われる時間を計測して改善しています。

何に役立つ?

大規模推薦モデルの学習設備で、追加のGPUを用意する前に無駄な待ち時間を減らす際の参考になります。実際の計算基盤への導入後の改善が報告されています。

この研究の面白いところ

一つの演算を速くするのではなく、ジョブの開始から終了・再起動までを横断して最適化しています。担当が異なるインフラでもETT%という指標で原因を整理しています。

どこまで分かった?

報告対象は著者らの推薦学習ワークロードと計算基盤です。最大ワークロードの50〜60%から85%への変化と、基盤全体の約80%から90%超への変化は対象範囲が異なります。平均15.5%の改善が相対比かポイント差かは要旨に明記されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模な推薦モデルの学習用計算基盤では、処理のライフサイクルに伴うオーバーヘッドが、目立たない形でアクセラレーターの能力を消費している。私たちの最大規模の推薦ワークロードは、数千台のGPU上で1日に数百億件の学習例を処理する。本研究以前は、開始から終了までの実経過時間のうち、新しいデータの学習を進めていたのは50〜60%にすぎなかった。本研究では、計算基盤全体の規模でこのライフサイクルのオーバーヘッドを調査し、学習スタック全体にわたる一連の最適化を提示する。 有効学習時間率(ETT%)を運用上の枠組みとして用い、失われた時間を計測し、担当が独立したインフラ構成要素ごとに原因を絞り込み、ジョブの再起動ごとに繰り返される処理を明らかにする。この分析に基づき、学習器の初期化時の通信削減とパイプラインの重ね合わせ、動的形状への対応、自動チューニングの探索削減、再利用可能なPyTorch 2のコンパイルキャッシュ、非同期チェックポイント保存、独立したモデル公開処理、復旧コストの削減などを行う。代表的なモデルで最適化を評価し、学習用計算基盤での影響を測定する。ETT%はすべてのベンチマークで改善し、平均改善率は15.5%、最大規模のワークロードでは85%に達した。導入後、計算基盤全体のETT%は約80%から90%超へ上昇した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Lifecycle overhead silently consumes accelerator capacity across large-scale recommendation training fleets. Our largest recommendation workloads process tens of billions train- ing examples per day on thousands of GPUs. Before this work, only 50-60% of their end-to-end wall time advanced training on new data. We present a fleet-scale study of this lifecycle overhead and a set of optimizations spanning the full training stack. We use Effective Training Time (ETT%) as an operational framework to instrument lost time, localize it to independently owned infrastructure components, and expose work repeated across job restarts. This analysis guides optimizations like communication elimination and pipeline overlap during trainer initialization; dynamic-shape handling, autotuning pruning, and reusable Py- Torch 2 compilation caches; asynchronous checkpointing; stan- dalone model publishing; and reductions in recovery cost. We evaluate the optimizations on representative models and measure their impacts in our training fleet. ETT% improves on every benchmark, by 15.5% on average, and reaches 85% on our largest workload. Fleet-wide ETT% rose from about 80% to above 90% after deployment.

arXiv ID: 2610.02057 / 要約の誤りについて