LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual UnderstandingEfficient VLM Inference

  2. KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints

    Sep 9, 2026Xi Shi, Mengxin Zheng, Qian LouKV CachingLLM Inference Acceleration

  3. Forward-Free LLM Depth Pruning via Weight Redundancy

    Sep 9, 2026Vincent-Daniel Yun, Woosang LimLLM PruningLLM Inference Acceleration

  4. Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding

    Sep 8, 2026Fengxiang Bie, Yuqing Jian, Yifan Yu +7Language Model PretrainingSpeculative Decoding

  5. RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving

    Sep 7, 2026Yang Liu, Zhaokai Luo, Huayi Jin +10KV CachingLLM Inference Acceleration

  6. Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG

    Sep 4, 2026Shuyu Guo, Shuo Zhang, Zhaochun RenRetrieval-Augmented GenerationLLM Inference Acceleration

  7. Unlocking Lossless Speedups in LLMs via Discrete Diffusion

    Sep 3, 2026Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham +14Diffusion Language Model InferenceLLM Inference Acceleration

  8. What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation

    Sep 3, 2026Bo Zeng, Yu Zhao, Yefeng Liu +3KV CachingKV-Cache Eviction

  9. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  10. Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Sep 3, 2026Heng Wang, Jielin Qiu, Wenting Zhao +8KV CachingMemory-Efficient Optimization

  11. RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory

    Sep 3, 2026Yuxiang Wang, Kunyu Feng, Yingda Shen +3Memory-Augmented Language ModelsRecurrent Transformers

  12. SGD-KV: Summarization Guided KV Cache Compression

    Sep 3, 2026Zeyu Liu, Woomin Song, Xuandi Fu +5KV CachingLong-Context Language Model Inference

  13. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4KV CachingLong-Context Language Model Inference

  14. CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

    Sep 1, 2026Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt +4Long-Context Language Model InferenceLLM Inference Acceleration

  15. hLLM: Single Pass Decoding for Generative Reranking

    Sep 1, 2026Emil Laftchiev, Prachi Agrawal, Moe Kayali +7Language Model DecodingLLM Reranking

  16. LatentPress: Context Compression Beyond Text and Vision

    Sep 1, 2026Zhengze Zhou, Hejian SangLLM Inference AccelerationLLM Context Management

  17. mzCache: On-Device LLM Memory Management under Multitasking

    Sep 1, 2026Hongseung Yu, Minsung Kim, Jongseok Park +1On-Device Language Model InferenceMemory-Efficient Inference

  18. PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition

    Sep 1, 2026Ziyan Gan, Fangxin Liu, Chenyang Guan +10Mixture-of-Experts PruningMixture-of-Experts Inference

  19. CacheBridge: Efficient Cross-Model KV Cache Transfer

    Sep 1, 2026Xingyu Qu, Siyuan Lu, Zhiyu Chen +2Transformer InferenceKV Caching

  20. SFAD: Speculative Factuality-Aware Decoding

    Sep 1, 2026Guanqiao Chen, Di Wang, Lijie HuLLM Hallucination MitigationSpeculative Decoding

  21. HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

    Aug 31, 2026Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6LLM QuantizationLLM Inference Acceleration

  22. A Model with No Head and Many Thoughts

    Aug 31, 2026Nikita Koriagin, Yaroslav Aksenov, George Bredis +3Efficient Language Model ReasoningLLM Inference Acceleration

  23. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1LLM InferenceKV Caching

  24. Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

    Aug 31, 2026Zhigeng Liu, Zhiyuan Ning, Ruixiao Li +5Long-Context Language Model InferenceLLM Inference Acceleration

  25. CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models

    Aug 31, 2026Wail Bouhedja, Amr Mohamed, Guokan ShangMasked Diffusion ModelsLLM Inference Acceleration

  26. TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories

    Aug 31, 2026Daniel Agyei Asante, Yang LiLLM CompressionLong-Context QA

  27. Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability

    Aug 31, 2026Matvei Tarasov, Salman Ahmadi-Asl, Andre L. F. de Almeida +1LLM CompressionLLM Inference Acceleration

  28. Event-Driven Language Models with Sparse Neural Activity for Neuromorphic Hardware

    Aug 31, 2026Simon Richter, Ruhai Lin, Jason Yik +4Activation SparsityLLM Inference Acceleration

  29. DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving

    Aug 31, 2026Yanqi Yu, Pingwei Sun, Jianchao Tan +4KV CachingMemory-Efficient Inference

  30. Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

    Aug 31, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +2LLM Inference AccelerationPrefix Caching

  31. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Long-Context Language Model InferenceLLM Inference Acceleration

  32. Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

    Aug 31, 2026Tong Yuan, Chengxi Liao, Zeyi WenMemory-Augmented Language ModelsKV Caching

  33. Verification-Aware Training for Speculative Decoding

    Aug 31, 2026Geonmo Gu, Byeongho Heo, HeeJae Jun +4Speculative DecodingLLM Inference Acceleration

  34. AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

    Aug 30, 2026Hanjun Luo, Qiushi Liu, Jingya Zhang +8Adaptive InferenceLLM Inference Acceleration

  35. ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding

    Aug 30, 2026Luxi Lin, Zhanpeng Zeng, Shuang Peng +2Speculative DecodingLLM Inference Acceleration

  36. Sliding-window beats linear attention

    Aug 28, 2026Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron +1KV CachingLLM Inference Acceleration

  37. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  38. Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting

    Aug 27, 2026Xinwei Qiang, Xiang Fang, Chang Chen +2Speculative DecodingLLM Inference Acceleration

  39. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization

  40. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  41. Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

    Aug 13, 2026Zixuan Lan, Yanhong Li, Jiawei ZhouInference-Time OptimizationLLM Inference Acceleration

  42. vToken: Token-Level Virtualization for Reclaimable KV Caches

    Aug 13, 2026Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen +4KV CachingKV-Cache Eviction

  43. SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

    Aug 13, 2026Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar HanawalEdge ComputingCost-Aware Inference

  44. Decoupled Contrastive Decoding via Expert-Aligned Drafting

    Aug 13, 2026Zhixuan Liu, Zhichen Dong, Yuanfu Wang +1Speculative DecodingLLM Inference Acceleration

  45. Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

    Aug 10, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisLLM InferenceLLM Inference Scheduling

  46. SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization

    Aug 10, 2026Gyudong Kim, Wonjun Han, Young Geun KimGPU Kernel OptimizationTensor Parallelism