cs.CVSep 19, 2026

SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to 265×265\times Single-GPU Acceleration of Visual Generation

Authors: Yuxi Liu, Haoyu Li, Zekun Zhang, Tengxu Sun, Yixiang Cai, Jiayong Li, Yifei Xia, Tianle Liu, +7 more

Organizations: Peking University, Melon Group · Alibaba Group · Tsinghua University · Harbin Institute of Technology · Peking University · University of Electronic Science and Technology of China

Abstract

Video diffusion transformers are expensive because attention dominates long spatiotemporal token sequences. We identify the \emph{high-sparsity trap}: at extreme attention sparsity, step-local training losses keep decreasing while terminal generation quality stagnates or degrades. The trap is one of supervision: the dominant terminal errors originate in the high-noise structure-generation stage, and terminal-aligned training corrects terminal errors that substantially extended step-local training cannot. This yields a simple staging principle: \emph{first adapt the sparse architecture into a coarse prior, then correct the terminal distribution}. We instantiate the principle as \method, a unified acceleration framework for visual generation that combines a short sparse warm-up, few-step trajectory-mixed distillation, and FP8 quantization with fused kernels. \method sustains 97%97\% attention sparsity with strong visual quality on long-sequence 720P generation across Wan2.1/Wan2.2 backbones and T2V/I2V tasks, and 90%90\% sparsity on Wan2.1-T2V-1.3B-480P. With 3-step CFG-free inference, \method achieves a 265×265\times end-to-end speedup over the 50-step CFG dense baseline for Wan2.1-T2V-14B-720P on a single RTX~5090 (220×220\times on H100), and denoises a Wan2.1-T2V-1.3B-480P video in 1.31.3s.

Figures & tables

Explore similar work

CardsList
  1. HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention

    May 14, 2026Xuzhe Zheng, Yuexiao Ma, Jing Xu +3Video Diffusion ModelsDiffusion Transformer

  2. Veda: Scalable Video Diffusion via Distilled Sparse Attention

    May 28, 2026Shihao Han, Hao Yang, Xinting Hu +3Video Diffusion ModelsDiffusion Transformer