KV-Cache Compression

Momentum

24 papers in the last four weeks, up 71% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 166

All topics
CardsList
  1. From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs

    Jun 8, 2026Zhanchao Xu, Haoyang Li, Qingfa Xiao +4Long-Context Language Model InferenceLLM Inference Acceleration

  2. FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

    Jun 8, 2026Yan Wang, Qifan Zhang, Jiachen Yu +12KV CachingLong-Context Language Model Inference

  3. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

    Jun 7, 2026Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang +3Mixed-Precision QuantizationKV Caching

  4. HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

    Jun 6, 2026Ziran Qin, Yuchen Jiang, Mingbao Lin +4KV CachingVisual Autoregressive Models

  5. IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

    Jun 6, 2026Junjie Li, Jiong Lou, Jie LiKV CachingKV-Cache Management

  6. Still: Amortized KV Cache Compaction in a Single Forward Pass

    Jun 5, 2026Charles O'Neill, Alex Sandomirsky, Harry Partridge +2KV CachingLong-Context Language Model Inference

  7. Towards Tight Bounds for Streaming Attention

    Jun 5, 2026Justin Y. Chen, Ying Feng, Piotr Indyk +3Efficient AttentionKV-Cache Compression

  8. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching

    Jun 5, 2026Qianli Ma, Zhiqing Tang, Hanshuai Cui +2LLM ServingKV Caching

  9. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

    Jun 4, 2026Yang Liu, ZhaoKai Luo, HuaYi Jin +5LLM ServingKV Caching

  10. Value-Aware Stochastic KV Cache Eviction for Reasoning Models

    Jun 2, 2026Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu +3LLM Inference EfficiencyKV Caching

  11. STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

    Jun 1, 2026Yuhang Han, Wenzheng Yang, Yujie Chen +4Vision-Language ModelsKV Caching

  12. MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference

    Jun 1, 2026Yu Li, Binxu Li, Tian LanKV CachingLong-Context Language Model Inference

  13. WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering

    May 30, 2026Jinnan Yang, Yan Wang, Zhen Bi +5Long-Context Language Model InferenceDiffusion Language Model Inference

  14. Linear Scaling Video VLMs for Long Video Understanding

    May 29, 2026Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos NieblesStreaming Video UnderstandingEfficient VLM Inference

  15. GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs

    May 29, 2026Junjie Peng, You Wu, Haoyi Wu +4KV CachingLong-Context Language Modeling

  16. Probing the Prompt KV Cache: Where It Becomes Dispensable

    May 28, 2026Vinayshekhar Bannihatti Kumar, Manoj Ghuhan Arivazhagan, Disha Makhija +1KV CachingKV-Cache Management

  17. Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation

    May 28, 2026Soumyadeep Jana, Sagar Nishad, Sanasam Ranbir SinghKV CachingLong-Context Language Modeling

  18. CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

    May 27, 2026Fengze Yang, Bo Yu, Xuewen Luo +2Efficient VLM InferenceKV-Cache Compression

  19. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +3LLM QuantizationKV Caching

  20. OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

    May 26, 2026Guangzhi Sun, Yixuan Li, Yudong Yang +1Streaming Video UnderstandingMultimodal Large Language Models

  21. NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

    May 26, 2026Hong Chen, Xiang Liu, Yubo Gao +5KV CachingLong-Context Language Modeling

  22. A Simple Plug-in for Improving Eviction-Based KV Cache Compression

    May 22, 2026Yuping Lin, Jiayuan Ding, Yue Xing +3KV CachingMemory-Efficient Optimization

  23. Adaptive Mass-Segmented KV Compression for Long-Context Reasoning

    May 22, 2026Junzhe Yang, Xiaoyu ShenKV CachingLong-Context Language Model Inference

  24. WorldKV: Efficient World Memory with World Retrieval and Compression

    May 21, 2026Jung Yi, Minjae Kim, Paul Hyunbin Cho +3KV CachingMemory-Augmented Video Generation