Speculative Decoding

Momentum

26 papers in the last four weeks, up 86% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 170

All topics
CardsList
  1. DRelay: Global Draft Context for Prefix-Aware Parallel Speculative Decoding Repair

    Oct 1, 2026Zhuoyu Wang, Junnan Huang, Xinyu ChenSpeculative DecodingRepair

  2. HAWK: Rethinking Multimodal Drafting for Speculative Decoding

    Sep 30, 2026Wenhan Yang, Anirudh Rao, Ashwin ChandraDraftsSpeculative Decoding

  3. Recovering Off-Policy Supervision for Speculative Decoding

    Sep 30, 2026Jungseob Lee, Chanjun Park, Sugyeong Eo +1Speculative DecodingDrafts

  4. AS2^2D: Accelerating On-Demand Audio Understanding on Mobile Devices

    Sep 29, 2026Yunzhe Li, Kyoungjun Park, Hongzi Zhu +1Audio UnderstandingSpeculative Decoding

  5. DScale: Scaling Block-Diffusion Speculative Decoding with Adaptive Verification

    Sep 29, 2026Rongjian Chen, Minxian Xu, Zhengxin Fang +2Speculative DecodingDiffusion Language Models

  6. Draft in Parallel, Condition Through Depth: Adjacent Causal Injection for Speculative Decoding

    Sep 28, 2026Haohui Zhang, Keyu Chen, Haocheng Sun +4Speculative DecodingDrafter

  7. Shallow Queries, Mature Values: Depth-Asynchronous Self-Speculation for Looped Transformers

    Sep 28, 2026Guanghao Li, Zihan Su, Hao Yu +6Speculative DecodingSelf-Speculative

  8. Reciprocal Guidance: Orchestrating Draft and Verify Budgets for Advancing the Diffusion-AR Self-Speculation Frontier

    Sep 28, 2026Linye Wei, Shutian Zheng, Haoyu Zeng +1Block-Diffusion DrafterSpeculative Decoding

  9. Faster Block-Diffusion Serving with Distribution-Free Risk Guarantees

    Sep 27, 2026Jungseob Lee, Dongyub Jude Lee, Chanjun Park +2Decode SpeedupSpeculative Decoding

  10. Tsubame: Tree Replay for Diffusion-Based Speculative Decoding

    Sep 27, 2026Yepeng Weng, Qiao Hu, Takehisa YairiBlock-Diffusion DrafterSpeculative Decoding

  11. When Parallel Drafter Meets Parallel Speculative Decoding

    Sep 23, 2026Fuliang Liu, Xue Li, Kun Qian +4Speculative DecodingDrafter

  12. Diffusion Drafts, AR Verifies: Accelerating Document OCR with Self-Speculative Decoding

    Sep 22, 2026Dohyun Kim, Sungjun Han, Hyungguk Kim +4Lingdt-Vl-OcrBlock-Diffusion Drafter

  13. H-Spec: Parallel Speculative Decoding Without a Drafter-Side KV Cache

    Sep 21, 2026Weifan Jiang, Krishna Teja Chitty-Venkata, Megan Flynn +6Speculative DecodingBlock-Diffusion Drafter

  14. Acceptance-Aware Draft Model Training for Speculative Decoding

    Sep 21, 2026Tianhua Xia, Mugilan Ganesan, Yifei Feng +3Speculative DecodingModel Training

  15. To Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals

    Sep 17, 2026Roy Eisenstadt, Ido Cohen, Edo Cohen-Karlik +2Speculative DecodingRepetition

  16. ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

    Sep 16, 2026Amir Ziashahabi, Hossein Entezari Zarch, Lei Gao +2Speculative DecodingLLM Inference Optimization

  17. ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding

    Sep 15, 2026Ziyang Ma, Zihong Zhang, Zuchao Li +4Speculative DecodingLLM Inference Optimization

  18. LoopSpec: Pipelined Self-Speculative Decoding for Looped Transformers

    Sep 15, 2026SangLyul Cho, Langqing Cui, Sehoon Kim +2Speculative DecodingTransformer Architectures

  19. Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding

    Sep 8, 2026Fengxiang Bie, Yuqing Jian, Yifan Yu +7Speculative DecodingDrafts

  20. Unlocking Lossless Speedups in LLMs via Discrete Diffusion

    Sep 3, 2026Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham +14Diffusion Language ModelsSpeculative Decoding

  21. Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

    Sep 2, 2026Alejandro Barón García, Feng Wang, Emilia Garcia Casademont +1Lingdt-Vl-OcrDocument Parsing

  22. Vision Is Not Overhead: One-Pass Block Drafting for Lossless Speculative Decoding in Vision-Language Models

    Aug 31, 2026Jungseob Lee, Seongtae Hong, Dongyub Jude Lee +4Recent Vision-Language ModelsSpeculative Decoding

  23. Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

    Aug 31, 2026Tong Yuan, Chengxi Liao, Zeyi WenSpeculative DecodingMemory-Augmented Framework

  24. Verification-Aware Training for Speculative Decoding

    Aug 31, 2026Geonmo Gu, Byeongho Heo, HeeJae Jun +4Speculative DecodingDrafts

  25. ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding

    Aug 30, 2026Luxi Lin, Zhanpeng Zeng, Shuang Peng +2Speculative DecodingDecoding

  26. DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

    Aug 13, 2026Tianyi Li, Yaxin Luo, Xinyi Shang +1Speculative DecodingDrafts

  27. SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

    Aug 13, 2026Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar HanawalLLM Inference OptimizationSpeculative Decoding

  28. Decoupled Contrastive Decoding via Expert-Aligned Drafting

    Aug 13, 2026Zhixuan Liu, Zhichen Dong, Yuanfu Wang +1Contrastive DecodingDrafter

  29. MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

    Aug 11, 2026Eunjeong Kim, Yeong Jun Jeon, Myeonggyun HanSpeculative DecodingLLM Inference Optimization

  30. Matryoshka Language Model Suites

    Aug 10, 2026Nathan Godey, Yoav ArtziLanguage ModelingMatryoshka Representation Learning

  31. LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

    Aug 9, 2026Zexun Lin, Yuan Feng, Junlin Lv +2Speculative DecodingDrafts

  32. DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

    Aug 5, 2026Amirmohammad Karimi, Chao Gao, Negar HassanpourSpeculative DecodingBlock-Diffusion Drafter

  33. SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

    Aug 5, 2026Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo +2Autoregressive RolloutLarge Language Model Reinforcement Learning

  34. Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes

    Aug 4, 2026Tao Jin, Phuong Minh Nguyen, Zhenzhu Yan +2Speculative DecodingDrafter

  35. Approximate Speculative Decoding

    Aug 4, 2026Yuannuo Feng, Zegang Peng, Yuxin Xie +5Speculative DecodingTruncation

  36. xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

    Aug 3, 2026Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim +4Block-Diffusion DrafterDrafts

  37. Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

    Aug 3, 2026Li Wang, Yi Su, Xiabao Wu +9Speculative DecodingSelf-Speculative

  38. A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding

    Jul 30, 2026Yuesong Liu, Yuan Zeng, Min Lyu +3Speculative DecodingSelf-Speculative

  39. Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

    Jul 29, 2026Weiye Shi, Fanxu Meng, Muhan ZhangSpeculative DecodingLLM Inference Optimization

  40. Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes

    Jul 29, 2026Tianyu Wang, Yuxuan Zhou, Wenbin Wang +3Speculative DecodingLLM Inference Optimization

  41. Adversarial Prompts for Acceptance Collapse in Speculative Decoding

    Jul 23, 2026Run Wang, Chaoyi Zhou, Xi Liu +7Speculative DecodingAdversarial Prompts

  42. Leaky Language Models: Stealing Architecture and Inference Optimizations via Per-Token Timing

    Jul 22, 2026Sadegh Majidi, Niloofar Mireshghallah, Kazem TaramAttacker Large Language ModelLLM Inference Optimization