arXiv論文メモ
新着一覧
cs.DC · 査読状況未確認

低精度パイプライン学習の状態と資源を明示的に管理

Explicit State and Resource Contracts for Low-Precision Pipeline Parallel Training under Captured Graphs

Genlang Chen, Junyi Zhu

この論文をやさしく読む

ひとことで言うと

GPUの演算をまとめて再実行するとき、低精度学習で変化する内部状態や勾配用メモリを取り違えないように管理する仕組みです。処理順序や所有者を明示し、正しさと高速化の両方を扱います。

何に役立つ?

考えられる用途は、FP8とパイプライン並列を使うモデル学習の実行基盤です。報告された検証には、基準実装とのビット一致、順序違反の検出、再起動後の再開が含まれます。

この研究の面白いところ

単なる演算の依存関係では表せない、スケーリング更新やキャッシュの世代を四つの不変条件で管理します。その所有権情報を、コピーを省く最適化にも使っています。

どこまで分かった?

1.82〜2.79倍はH800上のキャプチャ済みTransformer層と逐次実行の比較であり、学習全体の速度倍率とは記されていません。追加の1.132倍は勾配直接配置の効果です。要旨は他のGPUやすべてのスケジュールでの検証範囲を示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

CUDA Graphsは、固定された仮想アドレス上のテンソル演算を再実行することで、起動時のオーバーヘッドを取り除く。しかしFP8によるパイプライン学習では、その固定アドレスが表すスケーリング状態、マイクロバッチ、遅延された逆伝播タスクが絶えず変化する。1F1BやZero-Bubbleなどの分割逆伝播スケジュールは、バブルを最小限にするため入力勾配dIと重み勾配dWの計算を分離し、従来の後入れ先出し(LIFO)のライフサイクルを崩す。標準的なデータフローグラフでは、隠れた数値状態の更新、LIFOに従わない作業の所有権、キャッシュの有効性を実行時システムへ伝えられず、ストリーム間で検知されないデータ破損を招く。 低精度パイプライン学習のために、状態と資源に関する契約を明示する実行時システムQEffectを提示する。QEffectは、四つの基本的な不変条件を形式化する。(1)隠れたスケーリング更新の時間的な直列化、(2)保持された逆伝播資源の世代別所有権、(3)オプティマイザの更新境界をまたぐキャッシュ済み重みの有効性の版管理、(4)呼出し側とグラフのストリーム間での双方向の完了同期、である。これらの不変条件は逐次実行とキャプチャ済み実行を統一的に制御し、プロセスの再起動時に一時的なグラフ資源を適切に再構築できるようにする。また、作業所有権の意味論を活用し、余分なメモリコピーをなくすアフィンな勾配直接配置機構を導入する。 TorchTitanおよびNVIDIA Transformer Engineと統合したQEffectは、遅延スケーリングの切替えをまたいでもネイティブな基準実装との厳密なビット単位の一致を維持し、ストリーム間の順序違反を決定論的に検出して停止し、コールドスタートから問題なく再開できる。NVIDIA H800 GPU上では、キャプチャ済みTransformer層が逐次実行に対して1.82〜2.79倍の高速化を達成する。また、勾配の直接配置は、ランク当たり1ステップにつき96回の行列コピーを取り除くことで、さらに1.132倍の性能向上をもたらす。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

CUDA Graphs eliminate launch overheads by replaying tensor operations over static virtual addresses. However, FP8 pipeline training continuously alters the scaling states, microbatches, and deferred backward tasks that those fixed addresses represent. Split-backward schedules (e.g., 1F1B, Zero-Bubble) decouple input-gradient ($dI$) and weight-gradient ($dW$) computations to minimize bubbles, breaking traditional LIFO lifecycles. Standard dataflow graphs cannot inform the runtime of hidden numerical updates, non-LIFO work ownership, or cache validity, leading to silent cross-stream data corruption. We present QEffect, an explicit state and resource contract runtime for low-precision pipeline training. QEffect formalizes four foundational invariants: (1) temporal serialization of hidden scaling updates, (2) generational ownership of retained backward resources, (3) validity versioning for cached weights across optimizer boundaries, and (4) bidirectional caller-graph stream completion synchronization. These invariants uniformly govern eager and captured execution, allowing ephemeral graph resources to be cleanly rebuilt across process restarts. Leveraging work-ownership semantics, we also introduce an affine direct-gradient placement mechanism that eliminates redundant memory copies. Integrated with TorchTitan and NVIDIA Transformer Engine, QEffect maintains strict bitwise parity with native baselines across delayed-scaling rollovers, deterministically traps cross-stream ordering violations, and enables flawless cold-start resumption. On NVIDIA H800 GPUs, captured Transformer layers achieve 1.82--2.79x speedup over eager execution, while direct gradient placement delivers an additional 1.132x gain by eliminating 96 matrix copies per rank-step.

著者のコメント

12 pages, 5 figures

arXiv ID: 2609.23536 / 要約の誤りについて