KV-Cache Compression

Momentum

24 papers in the last four weeks, up 71% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 166

All topics
CardsList
  1. Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

    Aug 2, 2026Yujian Liu, Jiabao Ji, Li An +4KV CachingKV-Cache Eviction

  2. S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

    Aug 1, 2026Jialong Han, You Wu, Kewei TuKV CachingLong-Context Language Model Inference

  3. ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression

    Jul 31, 2026Yuhang Zhan, Lisi Chen, Shuo ShangSoftmax AttentionKV Caching

  4. DynaCalKV: Key-Value Cache Compression via Head Grouping and Adaptive Rank Allocation

    Jul 27, 2026Tan T. Nguyen, Quan V. DangKV CachingLow-Rank Approximation

  5. HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

    Jul 24, 2026Chao Fang, Jun Yin, Man Shi +1KV CachingMemory-Efficient Optimization

  6. C2^2KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

    Jul 20, 2026Chuheng Du, Junyi Chen, Hanlin Tang +7KV CachingLLM Inference Acceleration

  7. A JoLT for the KV cache: Near-Lossless KV Cache Compression via Joint Rank-bit Allocation

    Jul 14, 2026Rahul Krishnan, Volker SchulzKV CachingLow-Rank Matrix Decomposition

  8. How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit

    Jul 11, 2026Daming Luo, Christy Liang, Junyu XuanKV CachingKV-Cache Reuse

  9. What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents

    Jul 9, 2026Ashwin Gerard Colaco, Nada LahjoujiRate-Distortion TheoryLLM Memory

  10. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2KV CachingAutomatic Speech Recognition

  11. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

    Jul 7, 2026Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  12. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  13. KVpop -- Key-Value Cache Compression with Predictive Online Pruning

    Jul 6, 2026Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl +5KV CachingKV-Cache Eviction

  14. The risk of KV cache compression

    Jul 1, 2026Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno +2Transformer InferenceKV Caching

  15. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5KV CachingLong-Context Language Model Inference

  16. Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

    Jul 1, 2026Xiaomeng Fu, Jia Li, Yiming Hu +5Long-Horizon Video GenerationStreaming Video Generation

  17. SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

    Jun 30, 2026Amirhossein Abaskohi, Giuseppe Carenini, Peter West +1KV-Cache OffloadingKV Caching

  18. HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

    Jun 27, 2026Yuxuan Yang, Feiyang Ren, Bowen Zeng +4KV CachingLong-Context Language Model Inference

  19. Information-Aware KV Cache Compression for Long Reasoning

    Jun 25, 2026Jushi Kai, Zhuiri Xiao, Alexandra Birch +1KV CachingLong-Context Language Model Inference

  20. CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

    Jun 23, 2026Xiaolin Lin, Jingcun Wang, Olga Kondrateva +3LLM Inference EfficiencyKV Caching

  21. Dual Dimensionality for Local and Global Attention

    Jun 17, 2026Zhiyuan Wang, Xuan Luo, Sirui Zeng +1LLM CompressionDecoder-Only Language Models

  22. AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

    Jun 16, 2026Ning Ni, Yingjie LaoKV CachingLLM Safety Alignment

  23. Ablation, Statistical Inference, and Validation for KV-Cache Compression

    Jun 14, 2026Paolo D'Alberto, Ashish Siarasao, Elliott Delaye +1KV CachingRotation-Based Quantization

  24. Exploring a Layer-Wise Design Space for KV Cache Eviction

    Jun 13, 2026Chao Fei, Kaihua Liang, Hanzhi Hu +4KV CachingKV-Cache Eviction

  25. Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

    Jun 10, 2026Tianhao Chen, Yuheng Wu, Kelu Yao +3KV CachingMultimodal Large Language Models

  26. ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

    Jun 9, 2026Wenhao Liu, Hao Shi, Yunhe Li +7KV CachingMemory-Efficient Optimization

  27. FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

    Jun 9, 2026Yu Lu, Junjie Yang, Piotr Koniusz +2KV CachingLong-Horizon Video Generation