KV Caching

KV: Key-Value

Momentum

29 papers in the last four weeks, up 16% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 276

All topics
CardsList
  1. FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

    Jun 8, 2026Yan Wang, Qifan Zhang, Jiachen Yu +12KV CachingLong-Context Language Model Inference

  2. RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

    Jun 7, 2026Anirudh SekarLLM Inference EfficiencyKV Caching

  3. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

    Jun 7, 2026Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang +3Mixed-Precision QuantizationKV Caching

  4. HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

    Jun 6, 2026Ziran Qin, Yuchen Jiang, Mingbao Lin +4KV CachingVisual Autoregressive Models

  5. IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

    Jun 6, 2026Junjie Li, Jiong Lou, Jie LiKV CachingKV-Cache Management

  6. Still: Amortized KV Cache Compaction in a Single Forward Pass

    Jun 5, 2026Charles O'Neill, Alex Sandomirsky, Harry Partridge +2KV CachingLong-Context Language Model Inference

  7. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching

    Jun 5, 2026Qianli Ma, Zhiqing Tang, Hanshuai Cui +2LLM ServingKV Caching

  8. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

    Jun 4, 2026Yang Liu, ZhaoKai Luo, HuaYi Jin +5LLM ServingKV Caching

  9. QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving

    Jun 4, 2026Jianxin Yan, Wangze Ni, Zhenxin Li +8Retrieval-Augmented GenerationKV Caching

  10. Rethinking LoRA Memory Through the Lens of KV Cache Compression

    Jun 4, 2026Chunsheng Zuo, Liaoyaqi Wang, William Jurayj +2Retrieval-Augmented GenerationMemory-Augmented Language Models

  11. LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

    Jun 3, 2026Haocheng Xia, Mihir Pamnani, Hanxi Fang +2Retrieval-Augmented GenerationKV Caching

  12. Value-Aware Stochastic KV Cache Eviction for Reasoning Models

    Jun 2, 2026Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu +3LLM Inference EfficiencyKV Caching

  13. NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference

    Jun 2, 2026Mubarak Adetunji OjewaleLLM InferenceKV Caching

  14. STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

    Jun 1, 2026Yuhang Han, Wenzheng Yang, Yujie Chen +4Vision-Language ModelsKV Caching

  15. MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference

    Jun 1, 2026Yu Li, Binxu Li, Tian LanKV CachingLong-Context Language Model Inference

  16. Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

    Jun 1, 2026Bruce Changlong Xu, Adarsh Kumarappan, Mu ZhouLLM QuantizationKV Caching

  17. Leyline: KV Cache Directives for Agentic Inference

    May 31, 2026Bole Ma, Jan Eitzinger, Harald KoestlerLLM Inference EfficiencyKV Caching

  18. GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs

    May 29, 2026Junjie Peng, You Wu, Haoyi Wu +4KV CachingLong-Context Language Modeling

  19. BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

    May 29, 2026Liang He, Jingbo Wen, Qishi Zhan +4KV CachingLong-Context Language Model Inference

  20. CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs

    May 28, 2026Ryan FaheyKV CachingLLM Auditing

  21. Probing the Prompt KV Cache: Where It Becomes Dispensable

    May 28, 2026Vinayshekhar Bannihatti Kumar, Manoj Ghuhan Arivazhagan, Disha Makhija +1KV CachingKV-Cache Management

  22. OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation

    May 28, 2026Lin Zhao, Yushu Wu, Yifan Gong +2KV CachingLong Video Generation