KV Caching

KV: Key-Value

Momentum

29 papers in the last four weeks, up 16% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 276

All topics
CardsList
  1. What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation

    Sep 3, 2026Bo Zeng, Yu Zhao, Yefeng Liu +3KV CachingKV-Cache Eviction

  2. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  3. Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Sep 3, 2026Heng Wang, Jielin Qiu, Wenting Zhao +8KV CachingMemory-Efficient Optimization

  4. SGD-KV: Summarization Guided KV Cache Compression

    Sep 3, 2026Zeyu Liu, Woomin Song, Xuandi Fu +5KV CachingLong-Context Language Model Inference

  5. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4KV CachingLong-Context Language Model Inference

  6. CacheBridge: Efficient Cross-Model KV Cache Transfer

    Sep 1, 2026Xingyu Qu, Siyuan Lu, Zhiyu Chen +2Transformer InferenceKV Caching

  7. Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation

    Aug 31, 2026Atta Ul Asad, Ahsan Bilal, Muhammad Ali +2KV CachingRAG Evaluation

  8. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1LLM InferenceKV Caching

  9. DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving

    Aug 31, 2026Yanqi Yu, Pingwei Sun, Jianchao Tan +4KV CachingMemory-Efficient Inference

  10. Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

    Aug 31, 2026Tong Yuan, Chengxi Liao, Zeyi WenMemory-Augmented Language ModelsKV Caching

  11. Compression-Aware Abstention: Teaching LLMs to Refuse When KV-Compression Masks Remove Answer Evidence

    Aug 30, 2026Mohammadali Khodabandehlou, Bhaskar KrishnamachariLLM Hallucination MitigationKV Caching

  12. Sliding-window beats linear attention

    Aug 28, 2026Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron +1KV CachingLLM Inference Acceleration

  13. Small Frequency Corrections Can Change What Survives KV Cache Compression

    Aug 27, 2026Hong Chen, Yudong Zeng, Yongwei Huang +5KV CachingKV-Cache Eviction

  14. StepKV: Step-Aware KV Cache Compression for LLM Agents

    Aug 26, 2026Boyu Feng, Jiahong Liu, Yifan Li +7KV CachingKV-Cache Compression

  15. PAGE: Partition-Aware Gated KV-Cache Eviction

    Aug 26, 2026Pankaj Kumar, Subhankar MishraLong-Context RetrievalKV Caching

  16. Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

    Aug 20, 2026Matthias Seeger, Zeyu Zhang, Vihang Patil +2Fine-TuningKV Caching

  17. vToken: Token-Level Virtualization for Reclaimable KV Caches

    Aug 13, 2026Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen +4KV CachingKV-Cache Eviction

  18. QV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving

    Aug 12, 2026Yilin Liu, Rui Meng, Wangze Ni +5Retrieval-Augmented GenerationKV Caching

  19. Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

    Aug 11, 2026Zhijie Wu, Kento Kawaharazuka, Kei OkadaAdaptive InferenceKV Caching

  20. ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover

    Aug 11, 2026Minwoo Kim, Soochang Song, Namyoon Lee +2KV CachingEdge Computing

  21. RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation

    Aug 9, 2026Dongjie Xu, Kai Qian, Julius +6KV CachingKV-Cache Management

  22. CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents

    Aug 8, 2026Weizhong Huang, Jinchao Zhang, Xiawu ZhengKV CachingLLM Agent Memory

  23. CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG

    Aug 7, 2026Gyuwan Kim, Cheoneum Park, Tao YangLong-Context RetrievalRetrieval-Augmented Generation

  24. Addressable Memory for Video World Models

    Aug 7, 2026Xindi Wu, Sven Elflein, James Lucas +5KV CachingLong-Horizon Video Generation