高い注意疎性でも映像品質を保つ拡散モデル高速化
SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to $265\times$ Single-GPU Acceleration of Visual Generation
この論文をやさしく読む
ひとことで言うと
映像生成モデルの注意計算を大幅に間引きつつ、最終映像の品質を保つ学習手順。
何に役立つ?
考えられる用途は、指定された映像生成モデルの計算時間削減である。速度倍率は明記された基準法とGPUでの比較結果である。
この研究の面白いところ
各ステップの損失が改善しても完成映像は悪化し得ると見抜き、最終出力に合わせた蒸留を後段に入れる。
どこまで分かった?
265倍などの倍率はWan2.1、指定解像度、3ステップと50ステップ、GPUの比較条件に依存する。その他のモデルで同じ倍率は保証されない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
映像拡散Transformerは、長い時空間トークン列に対する注意計算が支配的なため費用が高い。本論文は、注意を極端に疎にすると、各ステップの学習損失は下がり続けても最終的な生成品質が停滞または低下する「高疎性の罠」を特定する。これは教師信号の問題である。最終的な主な誤りは高ノイズ段階での構造生成から生じ、最終出力に合わせた学習なら、ステップごとの損失だけで長く学習しても直せない誤りを修正できる。ここから、まず疎な構造を粗い事前分布に適応させ、その後に最終分布を修正するという段階的な原則を導く。 この原則を、短い疎構造のウォームアップ、少ないステップで軌道を混合する蒸留、融合カーネルを用いたFP8量子化を組み合わせる、画像・映像生成の統一的な高速化枠組みとして具体化する。Wan2.1とWan2.2の基盤モデル、テキストから映像を作る課題、画像から映像を作る課題において、長い系列の720P生成で注意の97%を疎にしても高い視覚品質を保った。Wan2.1のテキストから映像を作る1.3Bモデルの480P生成では90%の疎性を保った。 分類器不要ガイダンス(CFG)を使わない3ステップの推論では、単一のRTX 5090上で、Wan2.1のテキスト映像生成14Bモデルによる720P生成が、50ステップでCFGを使う密な基準法よりエンドツーエンドで265倍高速だった。H100では220倍だった。また、Wan2.1のテキスト映像生成1.3Bモデルによる480P映像のノイズ除去を1.3秒で行った。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-19(UTC)
- 最新改訂
- 2026-09-19 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-19 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Video diffusion transformers are expensive because attention dominates long spatiotemporal token sequences. We identify the \emph{high-sparsity trap}: at extreme attention sparsity, step-local training losses keep decreasing while terminal generation quality stagnates or degrades. The trap is one of supervision: the dominant terminal errors originate in the high-noise structure-generation stage, and terminal-aligned training corrects terminal errors that substantially extended step-local training cannot. This yields a simple staging principle: \emph{first adapt the sparse architecture into a coarse prior, then correct the terminal distribution}. We instantiate the principle as \method, a unified acceleration framework for visual generation that combines a short sparse warm-up, few-step trajectory-mixed distillation, and FP8 quantization with fused kernels. \method sustains $97\%$ attention sparsity with strong visual quality on long-sequence 720P generation across Wan2.1/Wan2.2 backbones and T2V/I2V tasks, and $90\%$ sparsity on Wan2.1-T2V-1.3B-480P. With 3-step CFG-free inference, \method achieves a $265\times$ end-to-end speedup over the 50-step CFG dense baseline for Wan2.1-T2V-14B-720P on a single RTX~5090 ($220\times$ on H100), and denoises a Wan2.1-T2V-1.3B-480P video in $1.3$s.
arXiv ID: 2609.23153 / 要約の誤りについて