専門家混合モデルの厳密な分位点調整と局所負荷補正
Exact Quantile Balancing and Load-Error Injection for Mixture-of-Experts
この論文をやさしく読む
ひとことで言うと
専門家混合モデルの学習で、専門家への仕事の割り当てを全体と小さな処理単位の両方で均等にする二つの方法を提案した。
何に役立つ?
大規模MoEの学習で専門家の未使用や処理の偏りを減らす設計に役立つ可能性がある。性能改善は論文の学習条件で示された結果である。
この研究の面白いところ
全体バッチのBF16分位点を少ない通信で厳密に計算し、別の仕組みで局所負荷の誤差を勾配へ直接反映した。
どこまで分かった?
評価は75億パラメータ、最大5000億トークンで学習したMoEについて報告されている。ほかの規模や構成で同じ改善幅になるとは要旨からは分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
専門家混合(MoE)モデルの学習では、専門家を十分に使うための全体的な負荷分散と、専門家並列処理を効率化するための局所的な負荷分散が必要になる。既存の分散型分位点調整(QB)はシャードごとに異なる分位点、または近似した全体分位点を使う。一方、トークンによらない専門家バイアスでは、マイクロバッチ単位の負荷分散を保証できない。 そこで、通信量をほとんど増やさずに全体バッチのBF16分位点を厳密に計算する厳密分位点調整(EQB)と、局所負荷の誤差をルーターのスコア勾配へ直接注入する負荷誤差注入(LEI)を提案する。最大5000億トークンで学習した75億パラメータのMoEで、EQBは単純なQBより全体の負荷分散と下流タスク性能を改善した。LEIは局所負荷分散を改善し、品質が同程度の条件でGShard損失を上回った。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Mixture-of-Experts (MoE) training requires global load balance to prevent expert under-utilization and local balance for efficient expert-parallel execution. Existing distributed Quantile Balancing (QB) uses shard-dependent or approximate global quantiles, while token-independent expert biases cannot ensure microbatch-level balance. We introduce Exact Quantile Balancing (EQB), which computes exact global-batch BF16 quantiles with negligible communication, and Load-Error Injection (LEI), which injects local load errors directly into router-score gradients. On 7.5B-parameter MoEs trained for up to 500B tokens, EQB improves global balance and downstream performance over naive QB, while LEI improves local balance and outperforms the GShard loss at comparable quality.
arXiv ID: 2609.28053 / 要約の誤りについて