KV Caching

KV: Key-Value

Momentum

29 papers in the last four weeks, up 16% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 276

All topics
CardsList
  1. Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation

    May 28, 2026Soumyadeep Jana, Sagar Nishad, Sanasam Ranbir SinghKV CachingLong-Context Language Modeling

  2. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +3LLM QuantizationKV Caching

  3. NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

    May 26, 2026Hong Chen, Xiang Liu, Yubo Gao +5KV CachingLong-Context Language Modeling

  4. Enabling KV Caching of Shared Prefix for Diffusion Language Models

    May 26, 2026Younghun Go, Jaehoon Han, Changyong Shin +2KV CachingKV-Cache Management

  5. Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion

    May 25, 2026Tuna Tuncer, Felix Becker, Thomas PfeilVideo Diffusion ModelsSelf-Attention

  6. IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

    May 25, 2026Xintong Yang, Hao Gu, Binxing Xu +6Memory-Augmented Language ModelsSelf-Attention

  7. A Simple Plug-in for Improving Eviction-Based KV Cache Compression

    May 22, 2026Yuping Lin, Jiayuan Ding, Yue Xing +3KV CachingMemory-Efficient Optimization

  8. Adaptive Mass-Segmented KV Compression for Long-Context Reasoning

    May 22, 2026Junzhe Yang, Xiaoyu ShenKV CachingLong-Context Language Model Inference

  9. WorldKV: Efficient World Memory with World Retrieval and Compression

    May 21, 2026Jung Yi, Minjae Kim, Paul Hyunbin Cho +3KV CachingMemory-Augmented Video Generation

  10. Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression

    May 21, 2026Wei Luo, Yi Huang, Songchen Ma +3KV CachingKV-Cache Eviction

  11. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

    May 21, 2026Junbin Xiao, Jiajun Chen, Tianxiang Sun +2KV CachingVideo QA

  12. ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning

    May 21, 2026Yeqiu Chen, Ziyan Liu, Zhenxin Huang +3Inference-Time SearchTree of Thoughts

  13. Tensor Cache: Eviction-conditioned Associative Memory for Transformers

    May 21, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +2Memory-Augmented Neural NetworksSelf-Attention

  14. EntmaxKV: Support-Aware Decoding for Entmax Attention

    May 20, 2026Gonçalo Duarte, Miguel Couceiro, Marcos V. TrevisoSelf-AttentionKV Caching

  15. Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation

    May 20, 2026Guotao Liang, Baoquan Zhang, Zhiyuan Wen +1KV CachingAutoregressive Image Generation

  16. Latent Cache Flow: Model-to-Model Communication Without Text

    May 19, 2026Maximillian Rossi, Prajwal Raghunath, Eugene WuKV CachingKV-Cache Compression

  17. OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

    May 19, 2026Zunhai Su, Rui Yang, Chao Zhang +11KV CachingRotation-Based Quantization

  18. KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference

    May 18, 2026Jian Lin, Jiazhi Mi, Zicong Hong +5KV-Cache OffloadingKV Caching

  19. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

    May 17, 2026Jiayi Yao, Samuel Shen, Kuntai Du +7KV-Cache OffloadingKV Caching

  20. ObjectCache: Layerwise Object-Storage Retrieval for KV Cache Reuse

    May 16, 2026Yu Zhu, Aditya Dhakal, Yunming Xiao +2LLM Inference EfficiencyKV-Cache Offloading

  21. HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling

    May 14, 2026Jonathan Cederlund, Axel Berg, William Isaksson +3KV CachingVisual Autoregressive Models