LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

    Aug 9, 2026Zexun Lin, Yuan Feng, Junlin Lv +2Inference-Time OptimizationSpeculative Decoding for Diffusion Language Models

  2. Efficient Test-Time Scaling for LLM-based Time Series Forecasting

    Aug 9, 2026Xuan-May Le, Minh-Tuan Tran, Ling Luo +3Long-Term Time Series ForecastingTime Series Forecasting

  3. RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention

    Aug 8, 2026Anthony. Lui, Mohamed. Elsaied, N. P. SavaniExpert OffloadingMixture-of-Experts Language Models

  4. Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

    Aug 7, 2026Yehan Yang, Junyuan Shang, Yang Li +3Attention Head AnalysisLLM Inference Acceleration

  5. The Sparsity Whisperer

    Aug 6, 2026Linghao Kong, Inimai Subramanian, Micah Adler +3LLM PruningLLM Inference Acceleration

  6. PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

    Aug 6, 2026Hao Yu, Jiabo Zhan, Kang Liu +8LLM Inference AccelerationDocument Parsing

  7. BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

    Aug 6, 2026Guanqiao Qu, Shuo Chen, Qian Chen +2Edge ComputingLLM Inference Scheduling

  8. MACRO: Markov Chain Routing of Transformer Layers

    Aug 6, 2026Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza +2Markov ModelsLLM Inference Acceleration

  9. DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

    Aug 5, 2026Amirmohammad Karimi, Chao Gao, Negar HassanpourSpeculative DecodingLLM Inference Acceleration

  10. SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

    Aug 5, 2026Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo +2RL for Language Model ReasoningSpeculative Decoding

  11. Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

    Aug 5, 2026Qiyuan Zhu, Dezhi Li, Pengyu Cheng +8Overthinking in Language ModelsKV Caching

  12. Training-Free Hashing-Based Attention via Binary Principal Components

    Aug 5, 2026Daohai Yu, Zhanpeng Zeng, Keyu Chen +6Long-Context Language ModelingLLM Inference Acceleration

  13. Elbow-Based MoE Routing: A Training-Free Inference Time Plugin for Expert Selection

    Aug 5, 2026Robin Pan, Raymond Liu, Daniel Fang +2Mixture-of-Experts InferenceLLM Inference Acceleration

  14. Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes

    Aug 4, 2026Tao Jin, Phuong Minh Nguyen, Zhenzhu Yan +2Speculative DecodingLLM Inference Acceleration

  15. Approximate Speculative Decoding

    Aug 4, 2026Yuannuo Feng, Zegang Peng, Yuxin Xie +5Speculative DecodingLLM Inference Acceleration

  16. PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

    Aug 4, 2026Dawei Liu, Haixu Song, Shuang Cheng +9Memory-Augmented Language ModelsLong-Context QA

  17. LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

    Aug 4, 2026Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh +1LLM ServingLLM Inference Acceleration

  18. ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

    Aug 3, 2026Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino +1Long-Context Language Model InferenceLLM Inference Acceleration

  19. Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

    Aug 3, 2026Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson +2Retrieval-Augmented GenerationOn-Device Language Model Inference

  20. Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

    Aug 3, 2026Li Wang, Yi Su, Xiabao Wu +9Speculative DecodingLLM Inference Acceleration

  21. Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

    Aug 2, 2026Ruokai Yin, Priyadarshini PandaGPU Kernel OptimizationLLM Inference

  22. OoO-Spec: Out-of-Order Semantic Speculation for Fast Tool Calling

    Aug 1, 2026Zhiheng Zhang, Mujie Xu, Feiyu Sun +1Speculative DecodingLLM Inference Acceleration

  23. TrimMoE A communication aware and adaptive depth framework for distributed edge inference

    Aug 1, 2026Ning Li, Shuting Bai, Xin Yuan +3Adaptive InferenceEdge Inference