arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

トークンと層に応じて計算を省くLLM推論手法

TopK-Guided: Adaptive, Budget-Aware Activation Sparsity for Efficient LLM Inference

Mukund Agarwalla, Chih-Jen Lin

この論文をやさしく読む

ひとことで言うと

LLMの計算を省く割合を、入力の各トークンとモデル内の各ブロックの重要度に合わせて配分する手法です。

何に役立つ?

再学習せずにLLMの推論計算を減らす際、一定の計算予算で精度を保つための方法として使うことが考えられます。

この研究の面白いところ

トークンごとの柔軟性を残しながら予算に上限と下限を設け、さらに誤差に敏感なブロックにも配慮しています。二つの調整の効果を別々にも評価しています。

どこまで分かった?

評価対象はLlama-2とLlama-3です。同程度とされるのは疎性に依存する射影計算量であり、要旨には実機での遅延や消費電力の改善値は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

活性化の疎性は、重要でない活性化値をゼロにし、対応する計算を省けるようにすることで、大規模言語モデル(LLM)の推論を高速化する。しかし、既存の学習不要な手法には異なるトレードオフがある。TEALなどのしきい値ベースの手法は、トークンごとに疎性の水準を調整するが、実際に達成される疎性を厳密には制御しない。一方、WINAなどのTopKベースの手法は、一定の疎性を確保するが、すべてのトークンに同じ疎性の予算を使う。さらに両者とも、ブロックごとの感度に大きな違いがあるにもかかわらず、Transformerの各ブロックに同じ予算を適用する。 本研究では、上下限を設けたトークン単位の疎性調整と、感度を考慮したブロック単位の予算配分を組み合わせ、両方の制約に対処する学習不要な手法TopK-Guidedを導入する。Llama-2およびLlama-3の各モデルで、WINAと実質的に同じ、疎性に依存する射影計算量を保ちながら、TEALとWINAに対してパープレキシティおよび下流タスクの精度を一貫して改善した。改善は高い疎性で最も大きかった。構成要素を取り除く比較実験から、二つの要素が相補的に改善をもたらすことが示された。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Activation sparsity speeds up large language model (LLM) inference by setting unimportant activations to zero so that the corresponding computations can be skipped. Existing training-free methods, however, make different trade-offs: threshold-based methods such as TEAL adapt the sparsity level to each token but do not tightly control the realised sparsity, while TopK-based methods such as WINA enforce a fixed sparsity level but use the same sparsity budget for every token. Both also apply the same budget across transformer blocks, despite large differences in block sensitivity. We introduce TopK-Guided, a training-free method that addresses both limitations by combining bounded token-level sparsity adaptation with sensitivity-aware block-level budget allocation. Across Llama-2 and Llama-3 models, TopK-Guided consistently improves perplexity and downstream accuracy over TEAL and WINA while preserving essentially the same sparsitydependent projection compute as WINA, with the largest gains at high sparsity. Ablations show that both components provide complementary improvements.

arXiv ID: 2610.01763 / 要約の誤りについて