arXiv論文メモ
新着一覧
cs.DC / cs.LG · 査読状況未確認

LLMの接頭辞キャッシュでLRUが強い理由を実運用記録で検証

When Fancy Eviction Fails: Rethinking Cache Replacement For LLM Prefix Reuse

Yiyu Liu, Minlan Yu, Juncheng Yang

この論文をやさしく読む

ひとことで言うと

2社の実運用記録で接頭辞キャッシュの追い出し方を比べ、単純なLRUが強い理由と追加で必要な工夫を調べた研究です。

何に役立つ?

長い会話やエージェント処理でLLMの計算費用を下げるため、キャッシュ管理方式を選ぶ材料になります。

この研究の面白いところ

複雑な従来型の方式がLRUにほぼ勝てず、活動中のセッションが規則的に接頭辞を再利用することが理由として示されています。

どこまで分かった?

評価は2社の実運用記録、14方式、指定したメモリ設定に基づきます。記録とシミュレータは公開予定と述べられており、要旨時点での公開は確認できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

長時間動く大規模言語モデル(LLM)のアプリケーションは、増え続ける文脈を繰り返し送るため、最初の計算の費用を減らすうえで接頭辞キャッシュが重要になる。しかし、エージェント型の作業負荷での振る舞いは十分に分かっていない。本研究は、2社の実運用の記録を調べ、HBMが制約となる設定と大きなメモリプールの設定で、14種類のキャッシュ追い出しアルゴリズムを評価する。将来の利用を知るBelady方式とは大きな差があるにもかかわらず、従来のキャッシュ向けに設計された複雑な方策は、LRUに比べてほとんど利点を示さなかった。理由は構造的で、接頭辞の再利用は活動中のセッションが規則的な間隔で進むことに大きく左右されるため、最近使ったかどうかが特によい予測材料となる。 一方、接頭辞キャッシュには、セッションごとの使用量の裾が重いことや、系列長とともに注意機構の計算量が増えるためキャッシュミスの費用が大きく変わることなど、新しい課題がある。これらを定量化するため、計算節約率と二つのオフラインの理想基準を導入する。結果から、有効な接頭辞キャッシュ管理は最近使用したかどうかを基礎としつつ、一度しか使われない接頭辞の素早い降格、費用の高いミスに対する計算量を考慮した部分追い出し、容量に応じた追い出し単位を選択的に加えるべきだと示す。今後の研究を支えるため、記録とシミュレータを公開する予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Long-running LLM applications repeatedly send growing context, making prefix caching critical for reducing prefill cost. Yet prefix-cache behavior under agentic workloads remains poorly understood. We study production traces from two companies and evaluate 14 eviction algorithms across HBM-constrained and large memory-pool settings. Despite a large gap to Belady, sophisticated policies designed for traditional caches provide little benefit over LRU. The reason is structural: prefix reuse is dominated by the regular pacing of active sessions, making recency unusually predictive. Prefix caching nevertheless introduces new challenges, including heavy-tailed session footprints and highly variable miss costs as attention computation grows with sequence length. We introduce the compute-savings ratio and two offline oracles to quantify these effects. Our results show that effective prefix-cache management should retain recency as its foundation while selectively adding quick demotion for one-hit prefixes, compute-aware partial eviction for expensive misses, and capacity-dependent eviction granularity. We will release the traces and simulator to support future research.

著者のコメント

19 pages, 20 figures, 6 tables

arXiv ID: 2609.28870 / 要約の誤りについて