LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models

    Aug 31, 2026Wail Bouhedja, Amr Mohamed, Guokan ShangMasked Diffusion ModelsLLM Inference Acceleration

  2. TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories

    Aug 31, 2026Daniel Agyei Asante, Yang LiLLM CompressionLong-Context QA

  3. Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability

    Aug 31, 2026Matvei Tarasov, Salman Ahmadi-Asl, Andre L. F. de Almeida +1LLM CompressionLLM Inference Acceleration

  4. Event-Driven Language Models with Sparse Neural Activity for Neuromorphic Hardware

    Aug 31, 2026Simon Richter, Ruhai Lin, Jason Yik +4Activation SparsityLLM Inference Acceleration

  5. DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving

    Aug 31, 2026Yanqi Yu, Pingwei Sun, Jianchao Tan +4KV CachingMemory-Efficient Inference

  6. Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

    Aug 31, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +2LLM Inference AccelerationPrefix Caching

  7. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Long-Context Language Model InferenceLLM Inference Acceleration

  8. Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

    Aug 31, 2026Tong Yuan, Chengxi Liao, Zeyi WenMemory-Augmented Language ModelsKV Caching

  9. Verification-Aware Training for Speculative Decoding

    Aug 31, 2026Geonmo Gu, Byeongho Heo, HeeJae Jun +4Speculative DecodingLLM Inference Acceleration

  10. AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

    Aug 30, 2026Hanjun Luo, Qiushi Liu, Jingya Zhang +8Adaptive InferenceLLM Inference Acceleration

  11. ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding

    Aug 30, 2026Luxi Lin, Zhanpeng Zeng, Shuang Peng +2Speculative DecodingLLM Inference Acceleration

  12. Sliding-window beats linear attention

    Aug 28, 2026Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron +1KV CachingLLM Inference Acceleration

  13. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  14. Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting

    Aug 27, 2026Xinwei Qiang, Xiang Fang, Chang Chen +2Speculative DecodingLLM Inference Acceleration

  15. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization

  16. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  17. Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

    Aug 13, 2026Zixuan Lan, Yanhong Li, Jiawei ZhouInference-Time OptimizationLLM Inference Acceleration

  18. vToken: Token-Level Virtualization for Reclaimable KV Caches

    Aug 13, 2026Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen +4KV CachingKV-Cache Eviction

  19. SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

    Aug 13, 2026Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar HanawalEdge ComputingCost-Aware Inference

  20. Decoupled Contrastive Decoding via Expert-Aligned Drafting

    Aug 13, 2026Zhixuan Liu, Zhichen Dong, Yuanfu Wang +1Speculative DecodingLLM Inference Acceleration

  21. Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

    Aug 10, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisLLM InferenceLLM Inference Scheduling

  22. SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization

    Aug 10, 2026Gyudong Kim, Wonjun Han, Young Geun KimGPU Kernel OptimizationTensor Parallelism