Diffusion Model Inference Acceleration

Latest papers 335

All topics
CardsList
  1. FastVR: Efficient Streaming Video Restoration with One-Step Diffusion

    Sep 29, 2026Xiaoxu Chen, Qin Yang, Haoran Bai +2Diffusion TransformerVideo Restoration

  2. RA-CFGCache: From Branch-Level Criteria to Guided-Risk Control under Classifier-Free Guidance

    Sep 29, 2026Yiming Liu, Ben Wan, Tongxuan Liu +5Classifier-Free GuidanceDiffusion Model Caching

  3. Sol-H3: Recursive Self-Improvement for MiniMax-H3 Inference Acceleration on Sol-Engine across Cloud and Edge

    Sep 28, 2026Yitong Li, Jincheng Yu, Junsong Chen +6Video Diffusion ModelsGPU Kernel Optimization

  4. Unlocking Few-Step Diffusion for Faithful Previews

    Sep 28, 2026Jing Jia, Sifan Liu, Guanyang WangDiffusion SamplingFew-Step Diffusion Sampling

  5. Faster Block-Diffusion Serving with Distribution-Free Risk Guarantees

    Sep 27, 2026Jungseob Lee, Dongyub Jude Lee, Chanjun Park +2Diffusion Language Model InferenceLLM Inference Acceleration

  6. AnyStep-WAM: Budget-Aligned Distillation and Adaptive Inference for World Action Models

    Sep 27, 2026Rui Wang, Xiangyu Wang, Donglin Yang +4Adaptive InferenceDiffusion Model Distillation

  7. GeoShrink: Accelerating Diffusion Transformers with Two Lines of Code

    Sep 27, 2026Haosen Li, Wenshuo Chen, Shaofeng Liang +3Video Diffusion ModelsDiffusion Transformer

  8. Tsubame: Tree Replay for Diffusion-Based Speculative Decoding

    Sep 27, 2026Yepeng Weng, Qiao Hu, Takehisa YairiSpeculative Decoding for Diffusion Language ModelsSpeculative Decoding

  9. OOD Generalization as a Bifurcation Problem

    Sep 27, 2026Nguyen-Thanh-Luong Doan, Quang-Vu Nguyen, Tang-Phu-Quy Le +1Diffusion Model GuidanceOOD Generalization

  10. Chameleon: Dynamic Format Adapter for Efficient Diffusion

    Sep 27, 2026Arnab Sanyal, Sandeep ChinchaliDiffusion Model QuantizationPost-Training Quantization

  11. FloodDiffusion 2: Efficient and Path Controllable Streaming Motion Generation

    Sep 27, 2026Yiyi Cai, Yuhan Wu, Kunhang Li +6Motion Diffusion ModelsHuman Motion Generation

  12. In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion

    Sep 26, 2026Yikai Wang, Xiao Han, Mengmeng Xu +9Long-Horizon Video GenerationDiffusion Model Caching

  13. ComplexSync: High-Fidelity and Real-Time Lip Sync in Complex Scenarios

    Sep 24, 2026Jiaran Cai, Xingpei Ma, Shenneng HuangVideo Diffusion ModelsAudio-Visual Synchronization

  14. Diffusion Drafts, AR Verifies: Accelerating Document OCR with Self-Speculative Decoding

    Sep 22, 2026Dohyun Kim, Sungjun Han, Hyungguk Kim +4Autoregressive DiffusionSpeculative Decoding

  15. Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

    Sep 17, 2026Haocheng Xi, Yiming Xie, Hexu Zhao +8Video Diffusion ModelsStreaming Video Generation

  16. Efficient 3D Whole-Body PET Image Denoising via Conditional Rectified Flow With Optimized Sampling Strategy

    Sep 15, 2026Jiale Shen, Guolin Wang, Chenhao Wang +3Rectified Flow3D Medical Imaging

  17. Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models

    Sep 15, 2026Kuluhan Binici, Cihan Acar, Shivam Aggarwal +2Diffusion Model SamplingDiffusion Timestep Scheduling

  18. VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

    Sep 14, 2026Xingyang Li, Dongyun Zou, Shining Zhang +8Video Diffusion ModelsDiffusion Transformer

  19. Fixed State, Long Reach: What a Constant-Size Cache Buys Block Diffusion at Scale

    Sep 14, 2026Vaibhav Singh, Pierre-André Noël, Torsten Scholak +2Blockwise Diffusion Language ModelsDiffusion Language Model Inference

  20. Diffusion Language Models for Mobile Edge Agentic AI: Foundations, Applications, and Challenges

    Sep 7, 2026Chenqi Li, Minghui Min, Dusit Niyato +1On-Device Language Model InferenceDiffusion Language Model Inference

  21. RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers

    Sep 6, 2026Zekun Zhang, Yixiang Cai, Yuxi Liu +9Rotary Positional EmbeddingsLow-Rank Attention

  22. GeoSPRINT: Geometric Redundancy-Aware Step Pruning for Inference in Diffusion Trajectories

    Sep 2, 2026Arpita JoshiDiffusion Model Inference AccelerationDiffusion Models