LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

    Aug 1, 2026Ziqiang Cui, Han Shi, Bowei He +8Multi-Token PredictionLLM Inference Acceleration

  2. TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

    Jul 31, 2026Zhenyu Zhang, Zhichao CaoLLM ServingLLM Inference Acceleration

  3. Studying quantization trade-offs for efficient inference deployment in machine translation

    Jul 31, 2026Jim Zhao, Sohir Maskey, Koen Oostermeijer +2LLM QuantizationLLM Inference Acceleration

  4. Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models

    Jul 31, 2026Jin-woo Lee, Minkyung Song, Junghyun Oh +4Memory-Augmented Language ModelsKV Caching

  5. LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

    Jul 31, 2026Yirui Liu, Ruoling Qi, Longwen Wang +5KV CachingLLM Inference Acceleration

  6. WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

    Jul 30, 2026Haozhe Hu, Hao Wu, Peiran Yin +3LLM PruningToken Pruning

  7. A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding

    Jul 30, 2026Yuesong Liu, Yuan Zeng, Min Lyu +3Long-Context Language Model InferenceSpeculative Decoding

  8. LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Jungjun Oh +2LLM QuantizationAI Accelerator Inference

  9. GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Byeongcheol Kim +2AI Accelerator InferenceRotation-Based Quantization

  10. Back from the Future: Key-Value Cache Management by Counter-Causal Surprise

    Jul 30, 2026Stephen Gould, Anton van den HengelKV CachingKV-Cache Eviction

  11. Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs

    Jul 30, 2026Jinyi Liu, Wei Chen, Pengyu Chen +4Activation SparsityStructured Sparsity

  12. DeepResearch Agent System

    Jul 30, 2026Yong Huang, Yulu Huang, for the team CollaborationDeep Research AgentsLLM Inference Acceleration

  13. InferScale: GPU-Native KV Injection for Personalized LLM Serving

    Jul 29, 2026Peter Li, Prashant PandeyLLM ServingMemory-Augmented Language Models

  14. Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

    Jul 29, 2026Weiye Shi, Fanxu Meng, Muhan ZhangSpeculative DecodingLLM Inference Acceleration

  15. Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes

    Jul 29, 2026Tianyu Wang, Yuxuan Zhou, Wenbin Wang +3Speculative DecodingLLM Inference Acceleration

  16. Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA

    Jul 28, 2026Tom Saliencro, Rohan Desai, Priya Nair +2Parameter-Free Mixture-of-Experts RoutingLLM Inference Acceleration

  17. At-the-Roofline Sparse Tensor Contractions on Vector Processors for Transformer Inference

    Jul 28, 2026Bowen Wang, Chi Zhang, Diyou Shen +3Efficient Neural Network InferenceTransformer Inference

  18. CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

    Jul 28, 2026Yufei Xue, Lin Niu, Hong Liu +6Long-Context Language Model InferenceLLM Inference Acceleration

  19. KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

    Jul 27, 2026Shuo Wang, Fang Xi, Wenyuan Huang +2LLM ServingKV-Cache Management

  20. HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

    Jul 24, 2026Chao Fang, Jun Yin, Man Shi +1KV CachingMemory-Efficient Optimization