Diffusion Language Model Inference

Latest papers 108

All topics
CardsList
  1. Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

    Aug 8, 2026Xuning He, Zinan Sheng, Yongding Tao +4Diffusion Language Model InferenceDiffusion Model Caching

  2. Retrofitting Linear Attention into Diffusion Language Models

    Aug 6, 2026Jinha Kim, Younghun Roh, Jaeyeon KimBlockwise Diffusion Language ModelsDiffusion Language Model Inference

  3. Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression

    Aug 4, 2026Angelo Nardone, Paolo FerraginaDiffusion Language Model InferenceDiffusion Language Models

  4. xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

    Aug 3, 2026Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim +4Speculative Decoding for Diffusion Language ModelsSpeculative Decoding

  5. REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models

    Aug 3, 2026Xiang Xia, Cheng Yan, Yiming Zhang +3Expert Load BalancingMixture-of-Experts Inference

  6. CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

    Jul 31, 2026Yifan Wu, Yufeng Zhang, Kenli LiDiffusion Model ServingDiffusion Language Model Inference

  7. Commit Locally, Exit Globally: Coordinating Adaptive Sampling and Early Exit in Diffusion Language Models

    Jul 30, 2026Chia-Ming Lee, Shao-Kai Liu, Ming-Ching Chang +3Diffusion Language Model InferenceDiffusion Language Model Decoding

  8. From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models

    Jul 29, 2026Seunggeun Kim, Jaeyeon Kim, Taekyun Lee +4Masked Diffusion ModelsDiffusion Language Model Inference

  9. Sangam: Efficiently Serving Diffusion LLMs with the AR Stack

    Jul 5, 2026Nitin Kedia, Saurabh Agarwal, Myungjin Lee +1LLM Inference SchedulingLLM Inference Serving

  10. TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding

    Jul 3, 2026Chengcheng Wang, Tingzhang Luo, Wenhao Li +2Diffusion Language Model InferenceDiffusion Language Model Decoding

  11. Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

    Jul 2, 2026Pranshu Chaturvedi, Parth Shroff, Tarun Suresh +2MambaLong-Context Language Model Inference

  12. Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

    Jul 1, 2026Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen +12Blockwise Diffusion Language ModelsEfficient Language Model Reasoning

  13. DiLaServe: High SLO Attainment Serving for Diffusion Language Models

    Jun 27, 2026Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham +1LLM ServingDiffusion Model Serving

  14. Affix Cache for Diffusion Large Language Models

    Jun 26, 2026Kaihua Liang, An Zhong, Xin Tan +4KV CachingMemory-Efficient Inference

  15. Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

    Jun 26, 2026Yuhang Chen, Xianfeng Wu, Jinhao Duan +11Diffusion Language Model InferenceParallel Decoding

  16. Improved Large Language Diffusion Models

    Jun 24, 2026Shen Nie, Qiyang Min, Shaoxuan Xu +7Language Model PretrainingMasked Diffusion Models

  17. HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval

    Jun 19, 2026Omin Kwon, Doyeon Kim, Jongseok Park +3KV-Cache OffloadingDiffusion Model Serving

  18. Diffusion Language Models: An Experimental Analysis

    Jun 17, 2026Thomas Bertolani, Davide Bucciarelli, Leonardo Zini +2Diffusion Language Model InferenceDiffusion Language Model Decoding

  19. Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens

    Jun 15, 2026Yizhen Yao, Qinglin Zhu, Runcong Zhao +4Diffusion Language Model InferenceDiffusion Language Model Decoding

  20. Efficient On-Device Diffusion LLM Inference with Mobile NPU

    Jun 11, 2026Tuowei Wang, Yanfan Sun, Ju RenAI Accelerator InferenceOn-Device Language Model Inference

  21. Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

    Jun 9, 2026Jing Xiong, Qi Han, Shansan Gong +5Long-Context Language Model InferenceDiffusion Language Model Inference