Diffusion Model Serving

Latest papers 10

All topics
CardsList
  1. Denoising Surface: Modeling and Predicting Inference Cost for Diffusion LLM Serving

    Sep 30, 2026Haoyu Zheng, Fangcheng Fu, Binhang Yuan +6Cost-Aware InferenceDiffusion Model Serving

  2. CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

    Jul 31, 2026Yifan Wu, Yufeng Zhang, Kenli LiDiffusion Model ServingDiffusion Language Model Inference

  3. FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving

    Jul 13, 2026Yaqi Qiao, Ping He, Songrun Xie +4Diffusion Model ServingDiffusion Model Inference Acceleration

  4. Sangam: Efficiently Serving Diffusion LLMs with the AR Stack

    Jul 5, 2026Nitin Kedia, Saurabh Agarwal, Myungjin Lee +1LLM Inference SchedulingLLM Inference Serving

  5. DiLaServe: High SLO Attainment Serving for Diffusion Language Models

    Jun 27, 2026Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham +1LLM ServingDiffusion Model Serving

  6. HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval

    Jun 19, 2026Omin Kwon, Doyeon Kim, Jongseok Park +3KV-Cache OffloadingDiffusion Model Serving

  7. GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

    Jun 11, 2026Xinwei Qiang, Yifan Hu, Shixuan Sun +6Diffusion TransformerDiffusion Model Serving

  8. FLARE: Diffusion for Hybrid Language Model

    Jun 1, 2026Yuchen Zhu, Jing Shi, Chongjian Ge +9Diffusion Model ServingDiffusion Language Model Inference

  9. SynerDiff: Synergetic Continuous Batching for Fast and Parallel Diffusion Model Inference

    May 9, 2026Ziqi Zhou, Peng Yang, Yuxin Liang +2Diffusion Model ServingDiffusion Model Inference Acceleration