KV Caching

KV: Key-Value

Momentum

29 papers in the last four weeks, up 16% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 276

All topics
CardsList
  1. GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache

    Jul 1, 2026Soosung Kim, Minjae Park, Eui-Young Chung +1LLM CompressionResidual VQ

  2. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5KV CachingLong-Context Language Model Inference

  3. From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

    Jun 30, 2026Jie Li, Tongyang Wang, Yong ChenLLM Inference EfficiencyLLM Serving

  4. RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

    Jun 30, 2026Wenhao Li, Jinhao Dong, Hailin Zhang +3KV CachingLong-Context Language Model Inference

  5. SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

    Jun 30, 2026Amirhossein Abaskohi, Giuseppe Carenini, Peter West +1KV-Cache OffloadingKV Caching

  6. HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

    Jun 27, 2026Yuxuan Yang, Feiyang Ren, Bowen Zeng +4KV CachingLong-Context Language Model Inference

  7. Affix Cache for Diffusion Large Language Models

    Jun 26, 2026Kaihua Liang, An Zhong, Xin Tan +4KV CachingMemory-Efficient Inference

  8. Information-Aware KV Cache Compression for Long Reasoning

    Jun 25, 2026Jushi Kai, Zhuiri Xiao, Alexandra Birch +1KV CachingLong-Context Language Model Inference

  9. ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

    Jun 25, 2026Le Tu Ngoc Minh, Jinyeong Lim, Dongsu HanStreaming Video UnderstandingKV Caching

  10. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching

  11. EpiKV: Epiphany-Aware KV Cache Eviction Without the Attention Matrix

    Jun 25, 2026Steven Kolawole, Virginia SmithKV CachingKV-Cache Eviction

  12. CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

    Jun 23, 2026Xiaolin Lin, Jingcun Wang, Olga Kondrateva +3LLM Inference EfficiencyKV Caching

  13. RoPE-Aware Bit Allocation for KV-Cache Quantization

    Jun 23, 2026Fengfeng Liang, Yuechen Zhang, Jiaya JiaKV CachingLLM Inference Acceleration

  14. Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets

    Jun 22, 2026Duc Duong, Hoang Anh Duy Le, Jianwen Xie +2KV CachingLong-Context Language Model Inference

  15. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

    Jun 20, 2026Xin GaoTransformer InferenceKV Caching

  16. Recency/Frequency Adaptive KV Caching for Large Language Model Serving

    Jun 19, 2026Yang Shen, Meghana Madhyastha, Robert Underwood +2LLM ServingKV Caching

  17. AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

    Jun 16, 2026Ning Ni, Yingjie LaoKV CachingLLM Safety Alignment

  18. KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

    Jun 15, 2026Mufei Li, Shikun Liu, Dongqi Fu +5KV CachingLong-Context Language Model Inference

  19. QK-Normed MLA: QK normalization without full key caching

    Jun 15, 2026Yizhou Han, Yao Zhao, Jun Zhou +2KV CachingTransformer Attention

  20. Ablation, Statistical Inference, and Validation for KV-Cache Compression

    Jun 14, 2026Paolo D'Alberto, Ashish Siarasao, Elliott Delaye +1KV CachingRotation-Based Quantization

  21. Exploring a Layer-Wise Design Space for KV Cache Eviction

    Jun 13, 2026Chao Fei, Kaihua Liang, Hanzhi Hu +4KV CachingKV-Cache Eviction

  22. Can I Buy Your KV Cache?

    Jun 11, 2026Luoyuan ZhangLLM Inference EfficiencyKV Caching

  23. MiniPIC: Flexible Position-Independent Caching in <100LOC

    Jun 11, 2026Nathan Ordonez, Thomas ParnellLLM Inference EfficiencyKV Caching

  24. Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

    Jun 10, 2026Tianhao Chen, Yuheng Wu, Kelu Yao +3KV CachingMultimodal Large Language Models

  25. ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

    Jun 9, 2026Wenhao Liu, Hao Shi, Yunhe Li +7KV CachingMemory-Efficient Optimization

  26. FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

    Jun 9, 2026Yu Lu, Junjie Yang, Piotr Koniusz +2KV CachingLong-Horizon Video Generation