Autoregressive Decoding

Latest papers 37

All topics
CardsList
  1. Nucleus Speculative Decoding: Plausibility-Aware Verification Beyond Exact Distribution

    Oct 6, 2026Shuhao Li, Fanghua Ye, Wanyu Lin +2Speculative DecodingLLM Inference Acceleration

  2. DLoop: Looped Speculative Decoding

    Oct 6, 2026Geonmo Gu, Byeongho Heo, HeeJae Jun +4Speculative DecodingLLM Inference Acceleration

  3. RVQ Position Aware Speculative Decoding for On Device Text to Speech

    Sep 29, 2026Berkin Durmus, Eduardo Pacheco, Zach Nagengast +1TTS SynthesisStreaming TTS Synthesis

  4. One Patch, Three Roles: What Is Actually Coupled in Autoregressive Time-Series Forecasting?

    Sep 20, 2026Ziang Li, Yue Huang, Guoxu Zhou +4Long-Term Time Series ForecastingTime Series Forecasting

  5. OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation

    Sep 14, 2026Xiangrui Yang, Cheng Peng, Yunfeng Zhao +9Linear AttentionAutoregressive Decoding

  6. Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference

    Sep 13, 2026Tian JinLong-Context Language Model InferenceEfficient Language Model Reasoning

  7. Line-Coupled Language Model

    Sep 7, 2026Shiyuan Li, Shaorong Zhang, Zhaorui Yang +3Multi-Token PredictionLanguage Model Decoding

  8. Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations

    Sep 3, 2026Yoto Fujita, Simon Leglaive, Laurent GirinSpeech EnhancementAutoregressive Decoding

  9. GeoPAR: Large-Scale Multi-Agent Combinatorial Optimization with Geometry-Guided Parallel Autoregressive Learning

    Sep 1, 2026Wenjian Wu, Zesheng Jia, Jiaying Tang +2Combinatorial OptimizationVehicle Routing

  10. ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

    Aug 8, 2026Zixiang Wan, Xusheng Yang, Zheng Wang +1Neural Audio CodecsAudio Tokenization

  11. Approximate Speculative Decoding

    Aug 4, 2026Yuannuo Feng, Zegang Peng, Yuxin Xie +5Speculative DecodingLLM Inference Acceleration

  12. Wavefront Parallelization for Efficient Learned Image Compression

    Jul 21, 2026Shimon Murai, Fangzheng Lin, Kasidis Arunruangsirilert +1Learned Image CompressionInference-Time Optimization

  13. Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

    Jul 12, 2026Zipeng Gao, Zhi Zheng, Qingrong Xia +5Speculative DecodingLLM Inference Acceleration

  14. Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

    Jul 10, 2026Junfei Zhan, Haoxun Shen, Mingang Guo +2Efficient VLM InferenceEdge Inference

  15. KVpop -- Key-Value Cache Compression with Predictive Online Pruning

    Jul 6, 2026Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl +5KV CachingKV-Cache Eviction

  16. Depth Exploration for LLM Decoding

    Jun 28, 2026Weisi Yang, Zipeng Sun, Stephen XiaLanguage Model DecodingLLM Inference Acceleration

  17. A Generalized Formalism of Auto-Regressive Decoding for Speech Processing

    Jun 16, 2026Julia Gachot, Philipp Allgeuer, Marie S. Bauer +1Speech ProcessingAutoregressive Decoding

  18. Real-Time Execution with Autoregressive Policies

    Jun 11, 2026Sangkyu Lee, Seohyeon Park, Tackgeun You +4Robotic ControlVision-Language-Action Models

  19. MemNovo: Look Back at the Spectrum for Balanced De Novo Peptide Sequencing from Mass Spectrometry

    Jun 10, 2026Dongxin Lyu, Jingbo Zhou, Hongxin Xiang +2Memory-Augmented Neural NetworksTransformer Inference

  20. ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling

    Jun 8, 2026Zhuoyan Tao, Jiatong Shi, Hye-jin Shim +1Speech Quality AssessmentAutoregressive Decoding

  21. AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

    Jun 7, 2026Yingxuan Ren, Yuxuan Lou, Yong Liu +4LLM Inference SchedulingBlockwise Diffusion Language Models

  22. FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

    May 10, 2026Junkang Zhou, Yefei He, Feng Chen +2Parallel DecodingAutoregressive Image Generation

  23. Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

    May 9, 2026Willy Fitra HendriaLLM InferenceKV Caching

  24. PACE: Post-Causal Entropy Modeling for Learned LiDAR Point Cloud Compression

    May 2, 2026Jiahao Zhu, Kang You, Dandan Ding +1Point Cloud CompressionAirborne Laser Scanning

  25. Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

    Apr 25, 2026Boqi Chen, Xudong Liu, Yunke Ao +1Visual Question AnsweringLanguage Model Calibration

  26. RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

    Apr 16, 2026Zihong Zhang, Zuchao Li, Lefei Zhang +2Speculative DecodingLLM Inference Acceleration

  27. Suffix-Constrained Greedy Search Algorithms for Causal Language Models

    Mar 1, 2026Ayoub Hammal, Pierre Zweigenbaum, Caio CorroConstrained Generative ModelingConstrained Decoding

  28. Decoding Order Matters in Autoregressive Speech Synthesis

    Jan 13, 2026Minghui Zhao, Anton RagniAdaptive InferenceTTS Synthesis

  29. Continuous Speculative Decoding for Autoregressive Image Generation

    Nov 18, 2024Zili Wang, Zheng Zhang, Kun Ding +3Visual Autoregressive ModelsSpeculative Decoding