arXiv論文メモ
新着一覧
cs.CV / cs.AI / cs.CL · 査読状況未確認

動画の空間と時間の重複を順に圧縮して推論を速める

VETO: Video Efficient Token Optimization for Vision Language Models

Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen, Winston H. Hsu

この論文をやさしく読む

ひとことで言うと

動画の1枚ごとの画像にある重複を減らしてから、似たフレーム同士をまとめる方法です。視覚言語モデルが読む情報量を減らし、動画の推論を速めます。

何に役立つ?

長い動画を扱う際の推論コスト削減に役立つことが期待されます。評価したモデルでは、正確さを保ちながら高速化でき、トークン予算を10%に絞った比較も報告されています。

この研究の面白いところ

空間と時間の両方を圧縮するだけでなく、空間を先に処理する順番が重要です。先に情報量を減らすことで、動画全体の時間的な対応付け自体を軽くしています。

どこまで分かった?

最大45%という値は報告された条件での高速化です。要旨には評価動画の構成や各条件の詳細はなく、任意の動画・モデルで同じ効果を保証するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚言語モデル(VLM)による長い動画の処理では、視覚トークン数に対して二次的に増える計算コストがボトルネックとなり、長尺の推論が非常に高価になる。単一の軸を圧縮する手法はこの問題を緩和するが、空間的な冗長性と時間的な冗長性を独立に扱うため、効率改善には越えにくい限界がある。 私たちは、学習を必須としない追加モジュールVETO(Video Efficient Token Optimization for Vision-Language Models)を提案する。VETOは2軸の圧縮でこのボトルネックを解消する。第一のフレーム内圧縮器は、最適輸送に着想を得た対応付けによって、各フレーム内の意味的に似たトークンを統合する。第二のフレーム間圧縮器は、時間的に冗長なフレームを特定して統合する。 設計上の要点は階層的な処理順序にある。空間次元を先に圧縮することで、後続の動画全体にわたる時間方向の対応付けのコストを大幅に減らし、単一軸の手法の効率上の壁を回避する。この利点は、最新の完全融合型アテンション基盤を使う場合にさらに大きくなる。実験では、正確さを維持または向上させながら、例えばLLaVA-OneVision-7Bで最大45%高速な推論を実現した。トークンを極端に制限した10%の予算下では、正解率55.7%を達成し、VFlowOptの54.9%、VisionZipの52.6%、FastVの47.9%を上回った。LLaVA-OneVision、InternVL-2.5、LongVAに広く適用できることを示し、すべての場合でゼロショット正解率を維持または改善した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Processing long videos with Vision-Language Models (VLMs) is bottlenecked by the quadratic cost of visual tokens, making long-form inference prohibitively expensive. While single-axis compression methods mitigate this, they hit a hard efficiency floor because they treat spatial and temporal redundancy independently. We present VETO (Video Efficient Token Optimization for Vision-Language Models), a training-optional plug-in that eliminates this bottleneck through dual-axis compression: (i) an intra-frame compressor that merges semantically similar tokens within each frame via optimal-transport inspired matching, and (ii) an inter-frame compressor that identifies and merges temporally redundant frames. The key design insight is hierarchical ordering: by first compressing spatial dimensions, VETO drastically reduces the cost of subsequent global temporal matching, bypassing the efficiency wall of single-axis approaches, with an advantage that grows with modern fully-fused attention infrastructure. Empirically, VETO achieves up to 45% faster inference (e.g., on LLaVA-OneVision-7B) while preserving or improving accuracy. Under extreme token starvation (10% budget), VETO outperforms VFlowOpt (54.9%), VisionZip (52.6%), and FastV (47.9%) with 55.7% accuracy. We demonstrate universal applicability across LLaVA-OneVision, InternVL-2.5, and LongVA, with zero-shot accuracy preserved or improved in all cases.

arXiv ID: 2610.01785 / 要約の誤りについて