arXiv論文メモ
新着一覧
cs.DC · 査読状況未確認

メモリ制約下でMoEの専門家配置と転送を調整する

MoE-CORE: Coordinated Expert Offloading and Residency for Memory-Constrained MoE Inference

Ke Yang, Yongji Gao, Xushi Li, Kui Luo, Sicheng Zhang, Tianming Zhou, Keyi Liu, Shufang Lu, Aoxuan Chen, Jie Meng, Jingchun Gao, Dan Li, Xinkai You, Dan Li, Zhixiang Xia, Yan Shi, Yang Liu, Yanjia Zeng and Liangjun Feng

この論文をやさしく読む

ひとことで言うと

大量の専門家の重みをすべてメモリに置けないMoEモデルで、必要な重みの配置と転送をまとめて管理する研究です。

何に役立つ?

メモリが限られた機器で大型MoEを動かす際に、どの層へキャッシュを割り当て、いつ転送するかを設計する参考になります。示された速度は評価した機器構成とモデルでの測定結果です。

この研究の面白いところ

入力を処理する段階と出力を生成する段階で管理方式を変え、層ごとの容量、過去の選択履歴、先読みを組み合わせています。ルーターの選択を守る主要構成と、専門家を近似的に代替する構成も区別しています。

どこまで分かった?

主要比較の出力上限は1K対128トークンで同一ではありません。最速の21.5ミリ秒は近似代替とMTPを併用した条件であり、主要構成の結果と混同できません。要旨末尾にはコードの案内文がありますが、提供要旨にリンク先は含まれていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

専門家を疎に活性化するとMoEモデルの計算量は減るが、専門家の重みは限られたデバイスメモリに収まりきらないことがある。オフロードによって小型AI機器でも推論できるようになる一方、ホストからデバイスへの転送が推論の処理経路に現れる。本研究では、メモリ制約のあるMoE推論で専門家のオフロードと常駐を協調させるシステムMoE-COREを提示する。プリフィル時には、交互に使うバッファに専門家層全体を準備する。デコード時には、層ごとに異なるキャッシュ容量、領域情報に基づく初期化、ルーティング履歴を考慮した置換、層をまたぐ先読みを組み合わせる。主要構成ではルーターが選んだ専門家を厳密に実行し、任意で利用できるスコアに基づく代替経路では、条件を満たす低スコアのキャッシュミスを処理する。 主要比較では、出力トークン数の上限をMoE-COREでは1K、vLLM Prefetchでは128としている。モデルごとに5種類のワークロードで評価したところ、DeepSeek-V4-Flash-W4A8における平均出力トークン当たり時間(TPOT)は、MoE-COREが38.0〜44.8ミリ秒、評価対象のvLLM Prefetch構成が1268.9〜1269.1ミリ秒だった。GLM-5.2-W4A8C8では、それぞれ206.6〜220.5ミリ秒と5941.5〜5941.8ミリ秒だった。NPUメモリの上限が84 GBの場合、DeepSeekのGSM8Kで測定した最良構成は、近似的な専門家の代替と深さ2の複数トークン予測(MTP)を用いてTPOT 21.5ミリ秒を達成した。これらの結果は、デバイスメモリの制約下で専門家の常駐と転送スケジューリングを協調させることの有効性を支持する。コードへの案内が示されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Sparse expert activation reduces MoE models' computation, yet expert weights can exceed limited device memory. Offloading makes inference feasible on a compact AI appliance but exposes host-to-device transfers to the inference path. We present MoE-CORE, a system that coordinates expert offloading and residency for memory-constrained MoE inference. It stages complete expert layers in alternating buffers during prefill. During decode, it combines nonuniform layer-wise cache capacity, domain-informed initialization, routing-history-aware replacement, and cross-layer prefetching. The main configuration executes router-selected experts exactly; an optional score-based substitution path handles eligible low-score misses. The main comparison uses 1K- and 128-token output caps for MoE-CORE and vLLM Prefetch, respectively. Across five workloads per model, MoE-CORE records a mean time per output token (TPOT) of 38.0-44.8 ms versus 1268.9-1269.1 ms for the evaluated vLLM Prefetch configuration on DeepSeek-V4-Flash-W4A8; the corresponding values on GLM-5.2-W4A8C8 are 206.6-220.5 and 5941.5-5941.8 ms. Under an 84-GB NPU-memory cap, the best measured DeepSeek GSM8K configuration achieves a TPOT of 21.5 ms with approximate expert substitution and multi-token prediction (MTP) at depth 2. These results support coordinated expert residency and transfer scheduling under a device-memory constraint. The code is here.

arXiv ID: 2610.01950 / 要約の誤りについて