注意の集中点が弱い言語モデルのKVキャッシュを値で整理
ValueDiff: Value-Geometric KV Cache Eviction for Sink-Suppressed LLMs
この論文をやさしく読む
ひとことで言うと
言語モデルの記憶容量を減らすとき、値ベクトルの違いで残す情報を決めた。
何に役立つ?
注意の集中点が弱い言語モデルで、KVキャッシュ容量を制限する推論設定に役立つ可能性がある。
この研究の面白いところ
値ベクトルの平均からの距離という単純な基準が、三つの評価で先行法を上回った点。
どこまで分かった?
性能は注意の集中点を抑えたモデルと指定した容量・課題での結果であり、すべての言語モデルでの優位は示していない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
QK正規化、ゲート付き注意、学習された注意の集中点、ロジットのソフトキャップを使う最近の大規模言語モデルでは、従来のKVキャッシュ削除法が頼る持続的な注意の集中点が弱い。これらのモデルでは、キーのベクトルの散らばりに比べ、値のベクトルの散らばりが大きい傾向があることを観察する。この値側の散らばりに着目し、ValueDiffを提案する。キャッシュ中の値ベクトルの平均からのL2距離でトークンを順位付けして削除する方法である。同じ評価値は、将来の注意について最大エントロピーを仮定したとき、影響を最小にする削除からも導かれる。 固定したキャッシュ容量の下で、入力の準備中は各ブロック境界、生成中は各復号段階で削除して評価した。厳しい2000トークンの容量を使うRULERでは、注意の集中点を抑えた七モデルにわたり、全量を保つ場合の性能の88~99%を維持し、七つ中六つで最良だった。4000トークンのLongBenchでは、この種のモデルで平均92%を維持し、最良の先行法の83%を上回った。MATH-500では、容量を25%にしたとき、評価したすべての該当モデルで全量を保たない方法の中で最良となり、ゲート付き注意のモデルでは先行法を最大約20ポイント上回った。三つの比較全体で、値ベクトルの幾何は、検索内容に依存しない削除の手がかりとしてより信頼できることが示された。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Modern LLMs with QK-normalization, gated attention, learned attention sinks, or logit softcapping exhibit weaker persistent attention sinks, on which existing KV cache eviction methods primarily rely. We observe that across these models, weaker sinks co-occur with greater value-vector dispersion relative to key-vector dispersion. Motivated by this value-side dispersion, we present ValueDiff, a value-geometric eviction that ranks tokens by the L2 deviation of their value vectors from the cache mean. The same score arises as the minimal-disturbance eviction under a max-entropy assumption about future attention. We evaluate under fixed cache budgets, with eviction at every block boundary during prefill and at every decoding step during generation. On RULER at a tight 2k token budget, ValueDiff retains 88--99\% of dense across seven sink-suppressed models (best on 6 out of 7). On LongBench at the 4k budget, ValueDiff averages 92\% retention across sink-suppressed models versus 83\% for the strongest prior baseline. On MATH-500, ValueDiff is the strongest non-dense method on every sink-suppressed model tested at the 25\% cache budget, outperforming prior methods by up to $\sim$20 points on gated-attention models. Across all three benchmarks, value geometry emerges as the more reliable query-invariant eviction signal for sink-suppressed models.
著者のコメント
10 pages, 3 Figues
arXiv ID: 2609.23314 / 要約の誤りについて