arXiv論文メモ
新着一覧
cs.AI / cs.CL · 掲載先の記載あり

L0正則化を使う軽量な専門家混合で言語モデルを高速化

Accelerating Dense LLMs via L0-regularized Mixture-of-Experts

Zhenyu Zhang, Jiudong Yang, Zhaowen Tao, Meng Chen

この論文をやさしく読む

ひとことで言うと

大きな言語モデルの計算を、軽量な専門家混合と正則化で整理し、回答性能を保ちながら速くする方法です。

何に役立つ?

考えられる用途は、既存の密なLLMの推論時間や計算負担を抑えることです。実験では既存の高速化方式より良い性能との両立を報告しています。

この研究の面白いところ

モデルの構成だけでなく、領域別のデータ選別に使うクラスタ混同行列と、学習時の動的バッチ処理も組み合わせています。

どこまで分かった?

2.5倍は最大の高速化であり、すべての設定での平均ではありません。要旨には対象モデル、機器、評価課題ごとの数値がなく、性能低下が完全にゼロだとは述べていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)は高い性能を達成する一方で、推論が遅く費用もかかる。既存の高速化手法はしばしば目立つ性能低下を招き、専門家混合(MoE)モデルには膨大な計算資源が必要となる。本論文では、ほぼ性能を失うことなく密なLLMを高速化するために、L0正則化を使う軽量なMoE方式L0-MoEを提案する。 本手法は、領域を考慮したデータセットの選別・整備にクラスタ混同行列を導入し、効率的な学習のため動的バッチ処理を適用する。実験では、L0-MoEが競争力のある性能を維持しながら密なモデルに対して最大2.5倍の高速化を達成し、既存のLLM高速化ベースラインを上回ることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
掲載先の記載あり

著者による掲載先の記載:Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, 2025。出版社での独立確認は未実施です。

arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language models (LLMs) achieve strong performance but suffer from slow and costly inference. Existing acceleration methods often lead to noticeable performance degradation, while Mixture-of-Experts (MoE) models require extensive computational resources. In this paper, we propose L0-MoE, a lightweight MoE approach using L0-regularization to accelerate dense LLMs nearly without performance loss. Our method introduces a cluster confusion matrix for domain-aware dataset curation and applies dynamic batching for efficient training. Experiments show that L0-MoE achieves up to 2.5x speedup over dense models while maintaining competitive performance, outperforming existing LLM acceleration baselines.

arXiv ID: 2609.21672 / 要約の誤りについて