KV Caching

KV: Key-Value

Momentum

29 papers in the last four weeks, up 16% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 276

All topics
CardsList
  1. Runtime Observability for Heterogeneous Attention Memory

    Aug 6, 2026Fanzhe Wei, Li Liu, Ziyang Wang +1KV CachingLLM Auditing

  2. QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

    Aug 5, 2026Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya +3KV CachingLong-Context Language Model Inference

  3. When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs

    Aug 5, 2026Jiaming Cheng, Subhransu Das, Rajiv RamnathKV CachingLLM Agent Evaluation

  4. Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

    Aug 5, 2026Qiyuan Zhu, Dezhi Li, Pengyu Cheng +8Overthinking in Language ModelsKV Caching

  5. Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms

    Aug 4, 2026Samuel Fernández-Menduiña, Amir Ziashahabi, Eduardo Pavez +2KV CachingVector Quantization

  6. TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

    Aug 4, 2026Wonpyo Park, Seung-won HwangLLM PruningKV Caching

  7. AnchorKV: Anchor-Residual KV Cache Compression

    Aug 3, 2026Malik Khalaf, Yara Shamshoum, Nitzan Hodos +2KV CachingLong-Context Language Model Inference

  8. DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

    Aug 3, 2026Yixiao Qian, Song Chen, Pengkai Wang +3Memory-Augmented Language ModelsKV Caching

  9. Output-Aware Rotation for INT2 KV-Cache Quantization

    Aug 3, 2026Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong +4LLM InferenceKV Caching

  10. Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

    Aug 3, 2026Mengting Ai, Jingrui He, Yue GuoCoT FaithfulnessReasoning Evaluation

  11. RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction

    Aug 2, 2026Changwoo Baek, Seungjun Shin, Kyeongbo KongKV CachingMemory-Efficient Optimization

  12. Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

    Aug 2, 2026Yujian Liu, Jiabao Ji, Li An +4KV CachingKV-Cache Eviction

  13. S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

    Aug 1, 2026Jialong Han, You Wu, Kewei TuKV CachingLong-Context Language Model Inference

  14. ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression

    Jul 31, 2026Yuhang Zhan, Lisi Chen, Shuo ShangSoftmax AttentionKV Caching

  15. Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models

    Jul 31, 2026Jin-woo Lee, Minkyung Song, Junghyun Oh +4Memory-Augmented Language ModelsKV Caching

  16. LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

    Jul 31, 2026Yirui Liu, Ruoling Qi, Longwen Wang +5KV CachingLLM Inference Acceleration

  17. SemPIC: Learning Semantic Position-Independent KV Caches

    Jul 30, 2026Hui Xie, Peng Xiao, Yutong Deng +3KV CachingMemory-Efficient Inference

  18. Back from the Future: Key-Value Cache Management by Counter-Causal Surprise

    Jul 30, 2026Stephen Gould, Anton van den HengelKV CachingKV-Cache Eviction

  19. InferScale: GPU-Native KV Injection for Personalized LLM Serving

    Jul 29, 2026Peter Li, Prashant PandeyLLM ServingMemory-Augmented Language Models

  20. Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns

    Jul 28, 2026Hong Chen, Kang Chen, Yuxuan Fan +4Memory-Augmented VLMsVisual Question Answering

  21. Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating

    Jul 27, 2026Maruthi Vemula, Neeraj Praneeth GajulaKV CachingKV-Cache Eviction

  22. DynaCalKV: Key-Value Cache Compression via Head Grouping and Adaptive Rank Allocation

    Jul 27, 2026Tan T. Nguyen, Quan V. DangKV CachingLow-Rank Approximation

  23. HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

    Jul 24, 2026Chao Fang, Jun Yin, Man Shi +1KV CachingMemory-Efficient Optimization

  24. HijackKV: New Threat in Position-Independent KV Cache Reuse

    Jul 22, 2026Yichi Zhang, Zhiqi Wang, Huan Zhang +1KV CachingLLM Security

  25. ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

    Jul 21, 2026Santiram Tiwari, Nishant Sinha, Kunal KislayMemory-Augmented VLMsKV Caching

  26. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  27. C2^2KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

    Jul 20, 2026Chuheng Du, Junyi Chen, Hanlin Tang +7KV CachingLLM Inference Acceleration

  28. Regularize or Localize: When Training-Time KV-Cache Geometry Pays Under Quantization

    Jul 19, 2026Libo Sun, Po-Wei Harn, Zewei Zhang +2KV CachingAttention Quantization

  29. Reflex: Real-Time VLA Control through Streaming Inference

    Jul 16, 2026Yuanchun Guo, Bingyan LiuFlow MatchingKV Caching

  30. A JoLT for the KV cache: Near-Lossless KV Cache Compression via Joint Rank-bit Allocation

    Jul 14, 2026Rahul Krishnan, Volker SchulzKV CachingLow-Rank Matrix Decomposition

  31. MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

    Jul 12, 2026Venkatesha Matam, Keon KimKV CachingKV-Cache Eviction

  32. How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit

    Jul 11, 2026Daming Luo, Christy Liang, Junyu XuanKV CachingKV-Cache Reuse

  33. KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

    Jul 10, 2026Peng Kuang, Haibo Jin, Xiaoyu Han +5Process Reward ModelsKV Caching

  34. COBS: Cumulant Order Block Sparse Attention

    Jul 10, 2026Alexander Tian, Aditya Ghai, Sanjit Neelam +2KV CachingLLM Inference Acceleration

  35. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1LLM Inference EfficiencyLLM Serving

  36. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2KV CachingAutomatic Speech Recognition

  37. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

    Jul 7, 2026Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  38. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  39. KVpop -- Key-Value Cache Compression with Predictive Online Pruning

    Jul 6, 2026Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl +5KV CachingKV-Cache Eviction

  40. Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

    Jul 2, 2026Jiaying Meng, Bojie LiLLM ServingKV Caching

  41. InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

    Jul 2, 2026Qianyu Chen, Ziteng Feng, Canran Xiao +1Continual Learning for LLMsMemory-Efficient Fine-Tuning

  42. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

    Jul 2, 2026Wenchen Han, Gingfung Matthew Yeung, Marco Barletta +3LLM InferenceKV Caching

  43. The risk of KV cache compression

    Jul 1, 2026Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno +2Transformer InferenceKV Caching

  44. Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning

    Jul 1, 2026Carlos Baquero, Luís BritoKV CachingLanguage Model Merging