Parallel Decoding

Latest papers 45

All topics
CardsList
  1. The Lattice of Transition Laws

    Oct 8, 2026T. Y. Tsui, Jiatao Gu, Lingjie LiuParallel DecodingDiffusion Sampling

  2. DRelay: Global Draft Context for Prefix-Aware Parallel Speculative Decoding Repair

    Oct 1, 2026Zhuoyu Wang, Junnan Huang, Xinyu ChenSpeculative DecodingLLM Inference Acceleration

  3. GroundAnything: Reconciling Parallel Decoding with Precise Visual Grounding at Flash Speed

    Sep 30, 2026Qize Yu, Lianrui Fan, Bowen Ping +19Efficient VLM InferenceVision-Language Grounding

  4. Counterfactual Probing for Parallel Unmasking with Hidden Forest Structure

    Sep 29, 2026Ryotaro Kawata, Satoshi Hayakawa, Taiji SuzukiSample ComplexityProbabilistic Graphical Models

  5. Shallow Queries, Mature Values: Depth-Asynchronous Self-Speculation for Looped Transformers

    Sep 28, 2026Guanghao Li, Zihan Su, Hao Yu +6Speculative DecodingRecurrent Transformers

  6. When Parallel Drafter Meets Parallel Speculative Decoding

    Sep 23, 2026Fuliang Liu, Xue Li, Kun Qian +4Speculative DecodingLLM Inference Acceleration

  7. H-Spec: Parallel Speculative Decoding Without a Drafter-Side KV Cache

    Sep 21, 2026Weifan Jiang, Krishna Teja Chitty-Venkata, Megan Flynn +6KV-Cache ManagementSpeculative Decoding

  8. Limits of Confidence in Diffusion

    Sep 17, 2026Russ Webb, Amitis Shidani, Alice Bizeul +1Diffusion SamplingParallel Decoding

  9. Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling

    Sep 15, 2026Lixuan Wei, Wei Zhou, Jianwen Wu +3Diffusion Language Model InferenceParallel Decoding

  10. Unlocking Lossless Speedups in LLMs via Discrete Diffusion

    Sep 3, 2026Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham +14Diffusion Language Model InferenceLLM Inference Acceleration

  11. Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting

    Aug 27, 2026Xinwei Qiang, Xiang Fang, Chang Chen +2Speculative DecodingLLM Inference Acceleration

  12. Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

    Aug 12, 2026Yushi Ye, Xu Chen, Haoyun Jiang +7Language Model DecodingDiffusion Language Model Inference

  13. PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

    Aug 6, 2026Hao Yu, Jiabo Zhan, Kang Liu +8LLM Inference AccelerationDocument Parsing

  14. Rethinking the Generation Order of Block Diffusion Language Models

    Jul 27, 2026Kai Syun Hou, James KwokDiffusion Model SamplingBlockwise Diffusion Language Models

  15. Empowering Cross-Domain Sequential Recommendation with Hybrid Tokenization and Serial-Parallel Decoding

    Jul 21, 2026Yuxuan Hu, Yuhao Wang, Tianbo Huang +4Sequential RecommendationParallel Decoding

  16. FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models

    Jul 20, 2026Bing Tian, Haikun Liu, Xiaocheng Zhong +5Blockwise Diffusion Language ModelsParallel Decoding

  17. Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

    Jul 3, 2026Wenzheng Zeng, Siyi Jiao, Chen Gao +2Temporal Video GroundingVideo Captioning

  18. Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

    Jun 26, 2026Yuhang Chen, Xianfeng Wu, Jinhao Duan +11Diffusion Language Model InferenceParallel Decoding

  19. Mean-Field Parallel Decoding for Discrete Diffusion Language Models

    Jun 14, 2026Tamim Zoabi, Ameen Ali, Liran Ringel +1Parallel DecodingDiffusion Language Model Decoding

  20. Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models

    Jun 9, 2026Yusuf Sahin, Ahmed Rockey Saikia, Volkan Cevher +1Masked Diffusion ModelsParallel Decoding

  21. TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

    Jun 2, 2026Peer Rheinboldt, Frédéric Berdoz, Roger WattenhoferSpeculative DecodingLLM Inference Acceleration

  22. Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

    Jun 1, 2026Siva Rajesh Kasa, Yasong Dai, Sumit Negi +1Language Model DecodingParallel Decoding