LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual UnderstandingEfficient VLM Inference

  2. KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints

    Sep 9, 2026Xi Shi, Mengxin Zheng, Qian LouKV CachingLLM Inference Acceleration

  3. Forward-Free LLM Depth Pruning via Weight Redundancy

    Sep 9, 2026Vincent-Daniel Yun, Woosang LimLLM PruningLLM Inference Acceleration

  4. Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding

    Sep 8, 2026Fengxiang Bie, Yuqing Jian, Yifan Yu +7Language Model PretrainingSpeculative Decoding

  5. RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving

    Sep 7, 2026Yang Liu, Zhaokai Luo, Huayi Jin +10KV CachingLLM Inference Acceleration

  6. Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG

    Sep 4, 2026Shuyu Guo, Shuo Zhang, Zhaochun RenRetrieval-Augmented GenerationLLM Inference Acceleration

  7. Unlocking Lossless Speedups in LLMs via Discrete Diffusion

    Sep 3, 2026Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham +14Diffusion Language Model InferenceLLM Inference Acceleration

  8. What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation

    Sep 3, 2026Bo Zeng, Yu Zhao, Yefeng Liu +3KV CachingKV-Cache Eviction

  9. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  10. Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Sep 3, 2026Heng Wang, Jielin Qiu, Wenting Zhao +8KV CachingMemory-Efficient Optimization

  11. RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory

    Sep 3, 2026Yuxiang Wang, Kunyu Feng, Yingda Shen +3Memory-Augmented Language ModelsRecurrent Transformers

  12. SGD-KV: Summarization Guided KV Cache Compression

    Sep 3, 2026Zeyu Liu, Woomin Song, Xuandi Fu +5KV CachingLong-Context Language Model Inference

  13. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4KV CachingLong-Context Language Model Inference

  14. CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

    Sep 1, 2026Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt +4Long-Context Language Model InferenceLLM Inference Acceleration

  15. hLLM: Single Pass Decoding for Generative Reranking

    Sep 1, 2026Emil Laftchiev, Prachi Agrawal, Moe Kayali +7Language Model DecodingLLM Reranking

  16. LatentPress: Context Compression Beyond Text and Vision

    Sep 1, 2026Zhengze Zhou, Hejian SangLLM Inference AccelerationLLM Context Management

  17. mzCache: On-Device LLM Memory Management under Multitasking

    Sep 1, 2026Hongseung Yu, Minsung Kim, Jongseok Park +1On-Device Language Model InferenceMemory-Efficient Inference

  18. PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition

    Sep 1, 2026Ziyan Gan, Fangxin Liu, Chenyang Guan +10Mixture-of-Experts PruningMixture-of-Experts Inference

  19. CacheBridge: Efficient Cross-Model KV Cache Transfer

    Sep 1, 2026Xingyu Qu, Siyuan Lu, Zhiyu Chen +2Transformer InferenceKV Caching

  20. SFAD: Speculative Factuality-Aware Decoding

    Sep 1, 2026Guanqiao Chen, Di Wang, Lijie HuLLM Hallucination MitigationSpeculative Decoding

  21. HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

    Aug 31, 2026Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6LLM QuantizationLLM Inference Acceleration

  22. A Model with No Head and Many Thoughts

    Aug 31, 2026Nikita Koriagin, Yaroslav Aksenov, George Bredis +3Efficient Language Model ReasoningLLM Inference Acceleration

  23. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1LLM InferenceKV Caching

  24. Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

    Aug 31, 2026Zhigeng Liu, Zhiyuan Ning, Ruixiao Li +5Long-Context Language Model InferenceLLM Inference Acceleration