KV Caching

KV: Key-Value

Momentum

29 papers in the last four weeks, up 16% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 276

All topics
CardsList
  1. HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

    Jul 24, 2026Chao Fang, Jun Yin, Man Shi +1KV CachingMemory-Efficient Optimization

  2. HijackKV: New Threat in Position-Independent KV Cache Reuse

    Jul 22, 2026Yichi Zhang, Zhiqi Wang, Huan Zhang +1KV CachingLLM Security

  3. ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

    Jul 21, 2026Santiram Tiwari, Nishant Sinha, Kunal KislayMemory-Augmented VLMsKV Caching

  4. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  5. C2^2KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

    Jul 20, 2026Chuheng Du, Junyi Chen, Hanlin Tang +7KV CachingLLM Inference Acceleration

  6. Regularize or Localize: When Training-Time KV-Cache Geometry Pays Under Quantization

    Jul 19, 2026Libo Sun, Po-Wei Harn, Zewei Zhang +2KV CachingAttention Quantization

  7. Reflex: Real-Time VLA Control through Streaming Inference

    Jul 16, 2026Yuanchun Guo, Bingyan LiuFlow MatchingKV Caching

  8. A JoLT for the KV cache: Near-Lossless KV Cache Compression via Joint Rank-bit Allocation

    Jul 14, 2026Rahul Krishnan, Volker SchulzKV CachingLow-Rank Matrix Decomposition

  9. MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

    Jul 12, 2026Venkatesha Matam, Keon KimKV CachingKV-Cache Eviction

  10. How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit

    Jul 11, 2026Daming Luo, Christy Liang, Junyu XuanKV CachingKV-Cache Reuse

  11. KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

    Jul 10, 2026Peng Kuang, Haibo Jin, Xiaoyu Han +5Process Reward ModelsKV Caching

  12. COBS: Cumulant Order Block Sparse Attention

    Jul 10, 2026Alexander Tian, Aditya Ghai, Sanjit Neelam +2KV CachingLLM Inference Acceleration

  13. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1LLM Inference EfficiencyLLM Serving

  14. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2KV CachingAutomatic Speech Recognition

  15. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

    Jul 7, 2026Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  16. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  17. KVpop -- Key-Value Cache Compression with Predictive Online Pruning

    Jul 6, 2026Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl +5KV CachingKV-Cache Eviction

  18. Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

    Jul 2, 2026Jiaying Meng, Bojie LiLLM ServingKV Caching

  19. InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

    Jul 2, 2026Qianyu Chen, Ziteng Feng, Canran Xiao +1Continual Learning for LLMsMemory-Efficient Fine-Tuning

  20. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

    Jul 2, 2026Wenchen Han, Gingfung Matthew Yeung, Marco Barletta +3LLM InferenceKV Caching

  21. The risk of KV cache compression

    Jul 1, 2026Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno +2Transformer InferenceKV Caching

  22. Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning

    Jul 1, 2026Carlos Baquero, Luís BritoKV CachingLanguage Model Merging