LLM学習基盤のGPUテストを選別しCIの時間と資源を削減
FastCI: Efficient GPU-Intensive CI for LLM Training Frameworks
この論文をやさしく読む
ひとことで言うと
GPUで学習や評価を実行する重いテストについて、変更への関係や重複を見て選び、実行順と負荷も調整してCIを速くする方法です。
何に役立つ?
LLM学習基盤の変更を確認する際の待ち時間とGPU使用量を減らす用途です。要旨ではByteDanceの対象基盤への導入まで報告しています。
この研究の面白いところ
テストを減らすだけでなく、同じ変更を等価な文脈で検証する重複を避け、失敗しそうなテストを先に実行します。検証目的と無関係な負荷も調整しています。
どこまで分かった?
数値は著者らの学習基盤のCIで得た結果です。カバレッジ保持の3.2%改善が相対比かポイント差かは要旨に明示されず、あらゆる不具合の検出を保証するとの記載もありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)が規模と複雑さを増すにつれ、その学習フレームワークも急速に進化している。そのため、これらのフレームワークの品質と安定性を維持するには継続的インテグレーション(CI)が重要である。しかし従来のソフトウェアとは異なり、LLM学習フレームワークのCIはGPUを多用するテストに依存し、通常はモデルの完全な学習や評価を伴う。このため、CI自体が速い開発サイクルの新たなボトルネックとなる。 本論文では、LLM学習フレームワーク向けCIの効率を改善するFastCIを提案する。FastCIは実行時の証拠を使って影響を受けるテストを選び、変更されたコードを等価な文脈で実行するテストを間引く。次に、リスクの高いテストを優先して潜在的な失敗を早く明らかにし、各テストが意図する検証範囲の外にある側面について、テストの処理負荷を最適化する。 著者らのLLM学習フレームワークのCI処理で評価したところ、現在配備されているCIパイプラインに比べ、FastCIはCIの所要時間を77.5%、GPU資源使用量を63.9%削減し、変更コードのカバレッジ保持を3.2%改善した。FastCIは現在、ByteDanceにおける著者らのLLM学習フレームワークのCIパイプラインへ統合されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
As large language models (LLMs) keep growing in size and complexity, their training frameworks evolve at a rapid pace as well. Therefore, continuous integration (CI) is critical for maintaining the quality and stability of these frameworks. However, unlike traditional software, CI for LLM training frameworks relies on GPU-intensive tests, which usually involve complete model training or evaluation. This leads CI itself to become a new bottleneck for fast-paced development. In this paper, we introduce FastCI, a framework that improves the efficiency of CI for LLM training frameworks. FastCI leverages runtime evidence to select affected tests and prune tests that execute changed code in equivalent contexts. Then FastCI prioritizes high-risk tests to expose potential failures earlier, and optimizes test workloads along dimensions outside the intended validation scope of each test. Evaluated on the CI workload of our LLM training framework, FastCI reduces the CI latency by 77.5% and the GPU resource usage by 63.9%, while improving the modified code coverage retention by 3.2%, compared with the currently deployed CI pipelines. FastCI has now been integrated into the CI pipelines of our LLM training framework at ByteDance.
arXiv ID: 2610.01967 / 要約の誤りについて