LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. BEAM: Binary Expert Activation Masking for Dynamic Routing in MoE

    May 14, 2026Juntong Wu, Jialiang Cheng, Qishen Yin +5Sparse Mixture-of-ExpertsMixture-of-Experts Inference

  2. PreFT: Prefill-only finetuning for efficient inference

    May 14, 2026Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu +4Fine-TuningLLM Serving

  3. Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

    May 13, 2026Anjir Ahmed Chowdhury, Syed Zawad, Feng YanSynthetic Data GenerationLLM Inference Acceleration

  4. Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

    May 13, 2026Gergely Szilvasy, Manuel Faysse, Maria Lomeli +5Self-AttentionKV Caching

  5. Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

    May 13, 2026Shuoyang Sun, Chang Dai, Hao Fang +6Adversarial Attacks on LLMsSpeculative Decoding

  6. STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes

    May 13, 2026Chenjun Xu, Zhennan Zhou, Zhan Su +3LLM PruningLLM Fine-Tuning

  7. Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion

    May 12, 2026Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham +3Language Model DecodingDiffusion Language Model Inference

  8. Search Your Block Floating Point Scales!

    May 12, 2026Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu +104-Bit QuantizationLLM Inference Acceleration

  9. Efficient LLM-based Advertising via Model Compression and Parallel Verification

    May 12, 2026Wenxin Dong, Chang Gao, Guanghui Yu +9LLM QuantizationLLM Compression

  10. BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion

    May 12, 2026Shaobin Zhuang, Yuang Ai, Jiaming Han +7Multi-Token PredictionAutoregressive Language Modeling

  11. Fast MoE Inference via Predictive Prefetching and Expert Replication

    May 12, 2026Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar +1Expert Load BalancingGPU Acceleration

  12. Block-Based Double Decoders

    May 11, 2026Asher Labovich, Benjamin Bradley, Vanessa Alexander +1Efficient Transformer InferenceLLM Inference Acceleration

  13. CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration

    May 11, 2026Yuning Han, Yangchenchen Jin, Dylan Zhao +1On-Device Language Model InferenceMemory-Efficient Inference

  14. ConQuR: Corner Aligned Activation Quantization via Optimized Rotations for LLMs

    May 11, 2026Chayne Thrash, Ali Abbasi, Soheil KolouriRotation-Based QuantizationLLM Inference Acceleration

  15. SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding

    May 11, 2026Anton Plaksin, Sergei Krutikov, Sergei Skvortsov +1LLM CompressionSpeculative Decoding

  16. Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration

    May 11, 2026Shuzhang Zhong, Haochen Huang, Shengxuan Qiu +3Inference-Time SearchTree of Thoughts

  17. GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference

    May 11, 2026Zengzipeng Tang, Yuxuan Sun, Wei Chen +2On-Device Language Model InferenceEdge Computing

  18. Attention Drift: What Autoregressive Speculative Decoding Models Learn

    May 11, 2026Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek +3Long-Context Language Model InferenceSpeculative Decoding

  19. Entropy-informed Decoding: Adaptive Information-Driven Branching

    May 10, 2026Benjamin Patrick Evans, Sumitra Ganesh, Leo ArdonLanguage Model DecodingLLM Inference Acceleration