LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. FD-RAG: Federated Dual-System Retrieval-Augmented Generation

    May 22, 2026Tianhao Gao, Kai Yang, Yiyang LiRetrieval-Augmented GenerationMemory-Augmented Language Models

  2. GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

    May 21, 2026Jianing Deng, Song Wang, Dongwei Wang +4Mixed-Precision QuantizationLLM Quantization

  3. Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression

    May 21, 2026Wei Luo, Yi Huang, Songchen Ma +3KV CachingKV-Cache Eviction

  4. Skill Weaving: Efficient LLM Improvement via Modular Skillpacks

    May 21, 2026Zhuo Li, Guodong Du, Zesheng Shi +5LLM CompressionLLM Inference Acceleration

  5. SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents

    May 21, 2026Mehrdad Saberi, Keivan Rezaei, Soheil FeiziMulti-Hop QATool-Augmented Language Model Agents

  6. EntmaxKV: Support-Aware Decoding for Entmax Attention

    May 20, 2026Gonçalo Duarte, Miguel Couceiro, Marcos V. TrevisoSelf-AttentionKV Caching

  7. Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

    May 20, 2026Reese Levine, Rithik Sharma, Nikhil Jain +5GPU AccelerationLLM Inference

  8. Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs

    May 19, 2026Haiquan Lu, Zigeng Chen, Gongfan Fang +2LLM QuantizationLong-Context Language Model Inference

  9. Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding

    May 19, 2026Yuhao Shen, Tianyu Liu, Xinyi Hu +9Speculative DecodingLLM Inference Acceleration

  10. FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

    May 19, 2026Yaojie Zhang, Jianuo Huang, Junlong Ke +5Speculative DecodingLLM Inference Acceleration

  11. OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

    May 19, 2026Zunhai Su, Rui Yang, Chao Zhang +11KV CachingRotation-Based Quantization

  12. Post-Trained MoE Can Skip Half Experts via Self-Distillation

    May 18, 2026Xingtai Lv, Li Sheng, Kaiyan Zhang +12Mixture of ExpertsMixture-of-Experts Inference

  13. Prune, Update and Trim: Robust Structured Pruning for Large Language Models

    May 18, 2026Diego Coello de Portugal Mecke, Tom Hanika, Lars Schmidt-ThiemeLLM PruningLLM Inference Acceleration

  14. Context Memorization for Efficient Long Context Generation

    May 18, 2026Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu +3Memory-Augmented Language ModelsLong-Context Language Model Inference

  15. KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference

    May 18, 2026Jian Lin, Jiazhi Mi, Zicong Hong +5KV-Cache OffloadingKV Caching

  16. Predictive Prefetching for Retrieval-Augmented Generation

    May 18, 2026Wuyang Zhang, Shichao PeiRetrieval-Augmented GenerationLLM Inference Acceleration

  17. OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

    May 18, 2026Zhongzhu Zhou, Donglin Zhuang, Jisen Li +4Rotation-Based QuantizationLLM Inference Acceleration

  18. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

    May 17, 2026Jiayi Yao, Samuel Shen, Kuntai Du +7KV-Cache OffloadingKV Caching

  19. Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

    May 17, 2026Kangkang Sun, Jianhua Li, Xiuzhen Chen +2Sequential Decision MakingOptimal Stopping

  20. TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

    May 16, 2026Hanzhang Shen, Haoran Wu, Yiren Zhao +1Mixed-Precision QuantizationLLM Inference Acceleration

  21. Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference

    May 16, 2026Mengtian Yang, Zhekun Zhang, Mingheng Wu +3LLM InferenceLLM Inference Acceleration

  22. CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

    May 16, 2026Jiwon Song, Dongwon Jo, Beomseok Kang +1Self-AttentionKV-Cache Management

  23. Lever: Speculative LLM Inference on Smartphones

    May 16, 2026Tuowei Wang, Fengzu Li, Yanfan Sun +2On-Device Language Model InferenceLLM Inference

  24. Towards Generalization of Block Attention via Automatic Segmentation and Block Distillation

    May 15, 2026Shuaiyi Li, Zhisong Zhang, Yan Wang +5Long-Context ModelingLLM Inference Acceleration

  25. IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

    May 15, 2026Ali Abbasi, Chayne Thrash, Haoran Qin +2LLM CompressionLow-Rank Matrix Decomposition

  26. STS: Efficient Sparse Attention with Speculative Token Sparsity

    May 15, 2026Ceyu Xu, Jiangnan Yu, Yongji Wu +1Self-AttentionLong-Context Language Model Inference