arXiv論文メモ
新着一覧
cs.AR · 査読状況未確認

LLMのKVキャッシュを高帯域フラッシュだけで管理する

HBFlex: A Flexible Memory System for Bridging Fine-Grained LLM States and Coarse-Grained HBF Parallel Execution

Shuzhang Zhong, Weikai Xu, Yifan Zhou, Tongbin Zhao, Tenghao Zhao, Yifei Kang, Cunyin Chang, Shu Li, Guangyu Sun, Meng Li

この論文をやさしく読む

ひとことで言うと

大容量の高帯域フラッシュをLLMのメモリに使う際に、KVキャッシュの細かな更新や消去が読み出しを妨げないようにする設計です。

何に役立つ?

モデル重みとKVキャッシュが大きいLLMサービングで、限られた実装資源をどう配分し、メモリ帯域を生かすか検討する参考になります。

この研究の面白いところ

読み出し配置だけでなく、計算中にまとめて書く方法や、データ寿命に応じた回収を組み合わせて最適化しています。

どこまで分かった?

1.58倍と3.30倍は、複数構成を評価したトレース駆動シミュレーションでの平均スループット向上の最大値です。製造済み実機での測定値や全構成共通の倍率ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)は、増大するモデル重みとKVキャッシュを収容するため、より大きなメモリ容量を必要としている。High-Bandwidth Flash(HBF)は、大規模なプレーン単位の並列性により、高い記憶密度と総読み出し帯域を提供し、LLMサービングの魅力的な選択肢となる。しかし、LLMを全面的にHBFから供給する場合、三つの課題が生じる。細粒度のKV読み出しは配置とアクセスの不均衡を生み、逐次的な書き込みは優先される読み出しを妨げ、異なる寿命のKVが混在するとガベージコレクションが増大する。 HBMとHBFの混成設計は、動的なKV管理のためにHBMを残すが、固定された実装予算の下では、その割当てがHBFに使える資源を減らし、HBFの総帯域を制限する。本研究では、KVの読み出し・書き込み・領域回収を協調的に最適化する、HBFのみのメモリシステムHBFlexを提案する。 HBFlexはKV配置とアテンション時のアクセスを均等化し、プレーンの利用効率を改善する。逐次更新を集約し、十分に長い計算時間帯の中で書き戻しを実行することで、読み書きの干渉を減らす。また、寿命を考慮したブロックへの詰め込みと、回収の延期を組み合わせ、有効ページの移動を削減する。 異なる構成にわたるトレース駆動シミュレーションでHBFlexを評価する。HBFの高い帯域と、動的なKVキャッシュの読み出し・書き込み・消去の効率的な管理により、平均スループットの向上倍率はFlashAccel比で最大1.58倍、H3比で最大3.30倍となる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language models (LLMs) require increasing memory capacity to accommodate growing model weights and KV caches. High-Bandwidth Flash (HBF) offers high memory density and aggregate read bandwidth through massive plane-level parallelism, making it an attractive option for LLM serving. However, serving LLMs entirely from HBF introduces three challenges: fine-grained KV reads create placement and access imbalance, incremental writes interfere with foreground reads, and mixed KV lifetimes amplify garbage collection. Hybrid HBM/HBF designs retain HBM to support dynamic KV management, but this allocation reduces the HBF resources available under a fixed packaging budget, limiting aggregate HBF bandwidth. We present HBFlex, a full-HBF memory system with coordinated optimizations for KV reads, writes, and reclamation. HBFlex balances KV placement and attention accesses to improve plane utilization. It aggregates incremental updates and schedules writeback within sufficiently long compute windows to reduce write--read interference. It also combines lifetime-guided block packing with deferred reclamation to reduce valid-page migration. We evaluate HBFlex through trace-driven simulation across different configurations. HBFlex achieves average throughput speedups of up to 1.58$\times$ over FlashAccel and 3.30$\times$ over H3, benefiting from higher HBF bandwidth and more efficient management of dynamic KV-cache reads, writes, and erases.

arXiv ID: 2609.18675 / 要約の誤りについて