追加トークンを使わず長い動画の情報を保持するPREM
PREM: Prefix-Steered Recurrent Memory for Long-Video Understanding
この論文をやさしく読む
ひとことで言うと
長い動画を小さな記憶状態に取り込み、その記憶を既存のプロンプト部分へ反映させて質問に答える方法です。メモリ専用の入力トークンは増やしません。
何に役立つ?
一つの長い動画に何度も質問する際に、動画の取り込みを再利用する用途が考えられます。六つのベンチマークで、視覚情報量を制限した場合の比較結果を報告しています。
この研究の面白いところ
256 KiBの状態を作る書き込みと、質問ごとの読み出しを分離し、既存の接頭部のK/Vを通じて記憶を使います。動画の記憶を新しいトークンとして追加しない設計です。
どこまで分かった?
ストリーミングの評価は終了時の回答設定です。要旨の改善値は%表記ですが、相対改善率かパーセントポイント差かは明記されていません。追加GPUメモリと連想状態の容量は別の量です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
長い動画の理解では、厳しいトークン予算の下で一時的な視覚的証拠を捉える必要があるが、既存手法はフレームを圧縮したり、メモリトークンを追加したり、内部のキー・バリュー(KV)キャッシュを変更したりする。本研究では、固定した視覚言語モデル(VLM)向けの、メモリトークンを使わない枠組みPrefix-Steered Recurrent Memory(PREM)を導入する。PREMは動画の取り込みと質問への回答を分離する。再帰的な書き込み器が視覚ストリームを小型の256 KiBの複数スロット連想状態へ要約し、質問を条件とする読み出し機構が、prefillの際に既存の非視覚プロンプト接頭部へ、メモリから得たキー・バリュー(K/V)の誘導変調を加える。これにより、追加のプロンプトトークンやデコード時の再帰処理なしに、一度書き込んだ後に何度も質問する推論が可能になる。オフラインとストリーミング終了時の設定で六つの長動画ベンチマークを評価したところ、検証したすべての視覚情報予算で、PREMは固定モデルの比較手法を一貫して上回る。16フレームという制限下では、Qwen2.5-VL-3Bのマクロ平均正解率を3.06%改善し、動作の反対語の識別では11.0%、局所的な重要情報の検索では9.9%改善する。これらの改善に必要なのは、基盤モデルのパラメータ数の0.24%に相当する調整と、ピークGPUメモリ0.03 GiBの追加使用である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Long-video understanding must capture transient visual evidence under strict token budgets, yet existing methods compress frames, append memory tokens, or alter internal key-value (KV) caches. We introduce Prefix-Steered Recurrent Memory (PREM), a memory-token-free framework for frozen vision-language models (VLMs). PREM separates video ingestion from query answering: a recurrent writer distills visual streams into a compact 256 KiB multi-slot associative state, while a question-conditioned readout adds memory-derived key/value (K/V) steering modulations to existing non-visual prompt prefixes during prefill. This enables write-once, query-many inference without extra prompt tokens or decoding recurrence. Across six long-video benchmarks in offline and streaming end-of-stream settings, PREM consistently outperforms frozen baselines at every evaluated visual budget. Under a constrained budget of 16 frames, PREM improves macro-average accuracy by 3.06% on Qwen2.5-VL-3B, with gains of 11.0% on action antonym identification and 9.9% on localized needle retrieval. These gains require tuning 0.24% of backbone parameters at 0.03 GiB of peak GPU memory overhead.
著者のコメント
22 pages, 11 figures, 12 tables
arXiv ID: 2609.23601 / 要約の誤りについて