Autoregressive Decoding

Latest papers 55

All topics
CardsList
  1. RVQ Position Aware Speculative Decoding for On Device Text to Speech

    Sep 29, 2026Berkin Durmus, Eduardo Pacheco, Zach Nagengast +1Autoregressive Text-To-SpeechAutoregressive Decoding

  2. When Parallel Drafter Meets Parallel Speculative Decoding

    Sep 23, 2026Fuliang Liu, Xue Li, Kun Qian +4Speculative DecodingDrafter

  3. SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

    Sep 21, 2026Kewei Zhang, Zheng Chen, Haotong Qin +1Matrix MultiplicationAutoregressive Decoding

  4. Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference

    Sep 13, 2026Tian JinLLM Inference OptimizationAutoregressive Language Models

  5. Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework

    Sep 2, 2026Shuyao Xiao, Shengling Wang, Haoyu Niu +4Multimodal GenerationAutoregressive Decoding

  6. Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving

    Aug 31, 2026Tongfei Guo, Lili SuAutonomous DrivingAutoregressive Language Models

  7. BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

    Aug 6, 2026Guanqiao Qu, Shuo Chen, Qian Chen +2LLM Inference OptimizationAutoregressive Decoding

  8. Answer First, Reason Later: Commitment Order in Diffusion LLMs

    Aug 6, 2026Jewon Yeom, Jaewon Sok, Seonghyeon Park +3Diffusion Language ModelsLLM Reasoning Strategies

  9. WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

    Aug 2, 2026Zhihao Zhu, Hanlin Shang, Mingwang Xu +6Autonomous DrivingDiffusion-Based Vision-Language-Actions

  10. Rethinking the Generation Order of Block Diffusion Language Models

    Jul 27, 2026Kai Syun Hou, James KwokDiffusion Language ModelsAutoregressive Decoding

  11. Unified Static-Dynamic Pruning for Efficient LLM Inference

    Jul 24, 2026Jinhyeok Kim, Yejoon Lee, Jaeyoung DoLLM Inference OptimizationDynamic Sparse Attention

  12. Wavefront Parallelization for Efficient Learned Image Compression

    Jul 21, 2026Shimon Murai, Fangzheng Lin, Kasidis Arunruangsirilert +1Learned Image CompressionAutoregressive Image Generation

  13. Adaptive Multi-Step Lookahead Decoding for Diffusion Language Models

    Jul 17, 2026Yingqian Cui, Wei Deng, Lantao Mei +4Diffusion Language ModelsMasked Diffusion Language Models

  14. T^2MLR: Transformer with Temporal Middle-Layer Recurrence

    Jul 16, 2026Ziyang Cai, Xingyu Zhu, Yihe Dong +2Transformer ArchitecturesRecurrent Model

  15. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1Kv-Cache ManagementLarge Language Model Serving

  16. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2Speech Language ModelsAutoregressive Decoding

  17. Trees from Marginals: Autoregressive drafting with factorized priors

    Jul 7, 2026Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy +1Autoregressive DecodingDrafts

  18. KVpop -- Key-Value Cache Compression with Predictive Online Pruning

    Jul 6, 2026Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl +5Key-Value Cache EvictionKey-Value Cache Compression

  19. Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

    Jul 6, 2026MY Pitsane, Hope MogaleAutoregressive DecodingContinuum

  20. Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

    Jul 3, 2026Wenzheng Zeng, Siyi Jiao, Chen Gao +2Video CaptioningAutoregressive Video Generation

  21. Affix Cache for Diffusion Large Language Models

    Jun 26, 2026Kaihua Liang, An Zhong, Xin Tan +4CacheLLM Inference Optimization

  22. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Multimodal ReasoningMultimodal Reasoning Benchmarks

  23. Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

    Jun 22, 2026Jiawei Xu, Minghui Liu, Aakriti Agrawal +2Diffusion Language ModelsMasked Diffusion Language Models

  24. A Generalized Formalism of Auto-Regressive Decoding for Speech Processing

    Jun 16, 2026Julia Gachot, Philipp Allgeuer, Marie S. Bauer +1Autoregressive DecodingAutoregressive Model

  25. Non-Autoregressive Minimum Bayes' Risk Decoding for Fast Speech Recognition

    Jun 16, 2026Hiroyuki Deguchi, Takatomo Kano, Katsuki Chousa +1Autoregressive DecodingRisk

  26. Positional Encoding in the Context of Memristor-Based Analog Computation for Automatic Speech Recognition

    Jun 11, 2026Benedikt Hilmes, Nick Rossenbach, Ralf SchlüterIn-Memory ComputingReram Crossbar

  27. ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

    Jun 11, 2026Sihwa Lee, Janghwan Lee, Donghoon Yoo +4Fp8Autoregressive Decoding

  28. MemNovo: Look Back at the Spectrum for Balanced De Novo Peptide Sequencing from Mass Spectrometry

    Jun 10, 2026Dongxin Lyu, Jingbo Zhou, Hongxin Xiang +2Tandem Mass SpectraAutoregressive Decoding

  29. TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

    Jun 8, 2026Yejin Lee, Junwon Moon, Hyoeun Kim +3Autoregressive Text-To-SpeechAutoregressive Decoding

  30. AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

    Jun 7, 2026Yingxuan Ren, Yuxuan Lou, Yong Liu +4Diffusion Language ModelsAutoregressive Decoding

  31. EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification

    Jun 6, 2026Da Li, Xinxin Li, Xingyu Cui +3Symbolic RegressionNeuro-Symbolic Framework

  32. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

    Jun 4, 2026Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3Autoregressive Decoding

  33. MURMUR: An Efficient Inference System for Long-Form ASR

    May 31, 2026Wei-Tzu Lee, Keisuke Kamahori, Baris KasikciAutomatic Speech RecognitionEfficient Long-Context Inference

  34. Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

    May 28, 2026Jeong Hun Yeo, Minsu Kim, Hyeongseop Rha +1Automatic Speech RecognitionAutoregressive Decoding

  35. KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

    May 14, 2026Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt +1Key-Value Cache CompressionToken Compression

  36. Attention Drift: What Autoregressive Speculative Decoding Models Learn

    May 11, 2026Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek +3Speculative DecodingDrafter

  37. APCD: Adaptive Path-Contrastive Decoding for Reliable Large Language Model Generation

    May 10, 2026Tianyu Zheng, Hong Wu, Jiaji ZhongContrastive DecodingLarge Language Model Decoding

  38. Stochastic Sparse Attention for Memory-Bound Inference

    May 3, 2026Kyle Lee, Corentin Delacour, Kevin Callahan-Coray +5Dynamic Sparse AttentionAutoregressive Decoding

  39. Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding

    May 1, 2026Lehan Pan, Ziyang Tao, Ruoyu Pang +3Speculative DecodingAutoregressive Decoding

  40. WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

    Apr 28, 2026Erfan Ramezani, Mohammad Mahdi Giahi, Mohammad Erfan Zarabadipour +2Whisper-Large-V3Automatic Speech Recognition

  41. RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

    Apr 16, 2026Zihong Zhang, Zuchao Li, Lefei Zhang +2Speculative DecodingAutoregressive Decoding

  42. Decoding Order Matters in Autoregressive Speech Synthesis

    Jan 13, 2026Minghui Zhao, Anton RagniAutoregressive Text-To-SpeechAutoregressive Decoding