KV-Cache Compression

Momentum

24 papers in the last four weeks, up 71% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 166

All topics
CardsList
  1. Dual-QK: Sharp Queries and Flat Keys for Prunable 2-bit KV Caches

    Oct 7, 2026Sunjoo Whang, Jungjun Oh, Minsung Kim +5KV-Cache CompressionKV-Cache Quantization

  2. CHASE: Channel-Aligned Structure Exploitation for Geometry-Aware Model Engineering

    Oct 7, 2026Wei Wang, Wei Jiang, Ziran LiuNeural Network CompressionKV-Cache Compression

  3. A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention

    Oct 6, 2026Davis Wertheimer, Haochen Shen, Ahan Gupta +6KV-Cache CompressionTransformer Attention

  4. Hybrid Latent Attention for Looped Language Models

    Oct 6, 2026Yuhan Chen, Siyuan Zhang, Nan Wang +2Long-Context Language Model InferenceLLM Inference Acceleration

  5. OVAL: Output-Aware Local Page Bases for KV Cache Retrieval

    Oct 5, 2026Ashkan Shahbazi, Chayne Thrash, Soheil KolouriLong-Context Language Model InferenceLLM Inference Acceleration

  6. Behavior-Preserving KV Cache Compression

    Oct 5, 2026Doo Hwan Hwang, Junyoung Jang, Junho Na +2KV-Cache EvictionLLM Inference Acceleration

  7. DeferKV: Rethinking Eviction Timing for One-Shot KV Cache Compression

    Oct 5, 2026Zhe Wang, Jiakai Li, Yujia Sun +2Long-Context Language Model InferenceKV-Cache Eviction

  8. The Optimization Landscape of Learning Compacted Context Models

    Oct 5, 2026Thomas Villeneuve, Alex Sandomirsky, Charles O'Neill +2LLM CompressionKV-Cache Compression

  9. KV-Kaizen: Learning Context-Adaptive Cache Compression Choices

    Sep 29, 2026Joao Monteiro, Louis Béthune, Anastasiia Filippova +3LLM Inference AccelerationLow-Rank Compression

  10. ARC-KV: Amortizing Anchor Search for Reconstruction-Based KV Cache Compaction

    Sep 29, 2026Zheyu Shen, Guanhua Wang, Dezhan Tu +5Long-Context Language ModelingKV-Cache Management

  11. Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression

    Sep 28, 2026Xingyu Zhu, Pu, Yi +6Long-Context RetrievalKV-Cache Compression

  12. Does Execution Require Target KV Fidelity? A Mixed-Fidelity KV Runtime for LLM Serving

    Sep 27, 2026Jiantong Jiang, Yue Yang, Peiyu Yang +1LLM ServingKV-Cache Management

  13. MILO: Efficient Many-shot In-Context Learning with Block-wise Low-rank Compression

    Sep 24, 2026Youpeng Zhao, Tian Tan, Liqian Peng +2Memory-Efficient InferenceLLM Inference Acceleration

  14. Tensor Decomposition of Transformer Key-Value Caches: Spectral Structure and Format Comparison

    Sep 23, 2026Rahul Krishnan, Volker SchulzTensor DecompositionTT Decomposition

  15. QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models

    Sep 22, 2026Jiaqi Zhao, Xiaobin Hu, Bo Yin +3KV-Cache CompressionKV-Cache Quantization

  16. Compressing Long Context into Answer-Aligned Memory Embeddings for LLM Inference

    Sep 22, 2026Md Mostafizer Rahman, Md Faizul Ibne Amin, Md Shahajada Mia +2LLM Inference EfficiencyLong-Context Language Model Inference

  17. ARM: Attention with Routed-Memory for Learnable Sparse Control

    Sep 21, 2026Qiuhao Zeng, Jerry Huang, Peng Lu +7Memory-Augmented Language ModelsLong-Context Language Model Inference

  18. KV-COBRA: KV Cache Compression via Co-Optimized Bit-Rank Allocation

    Sep 21, 2026Sihyeon Ha, Jaeho Lee, Yo-Seb JeonLow-Rank CompressionKV-Cache Compression

  19. LLM Inference in a Flash!

    Sep 14, 2026Sebastian Zhao, Minseo Kim, Coleman Hooper +5LLM QuantizationCompute-in-Memory

  20. Pixel Decodability Is Not a Compression Signal: Causally Evaluating Importance Proxies for Visual KV-Cache Eviction

    Sep 14, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1KV CachingKV-Cache Eviction

  21. TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

    Sep 9, 2026Yuhao Wang, Mu Qiao, Xindong Zhang +3KV-Cache CompressionVisual Token Pruning

  22. Jacap: Robust KV Cache Eviction via Jacobian-Based Nonlinear Information Capacity Preservation

    Sep 8, 2026Jiaming Yang, Chenwei Tang, Liangli Zhen +2KV CachingKV-Cache Eviction

  23. MetaKV: Adaptive KV Cache Compression for Constrained LLM Inference

    Sep 7, 2026Michael Wang, Keith Li, Roozbeh BostandoostLLM Inference EfficiencyLLM Inference

  24. What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation

    Sep 3, 2026Bo Zeng, Yu Zhao, Yefeng Liu +3KV CachingKV-Cache Eviction

  25. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  26. Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Sep 3, 2026Heng Wang, Jielin Qiu, Wenting Zhao +8KV CachingMemory-Efficient Optimization

  27. SGD-KV: Summarization Guided KV Cache Compression

    Sep 3, 2026Zeyu Liu, Woomin Song, Xuandi Fu +5KV CachingLong-Context Language Model Inference

  28. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4KV CachingLong-Context Language Model Inference

  29. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Long-Context Language Model InferenceLLM Inference Acceleration

  30. Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

    Aug 31, 2026Tong Yuan, Chengxi Liao, Zeyi WenMemory-Augmented Language ModelsKV Caching

  31. Compression-Aware Abstention: Teaching LLMs to Refuse When KV-Compression Masks Remove Answer Evidence

    Aug 30, 2026Mohammadali Khodabandehlou, Bhaskar KrishnamachariLLM Hallucination MitigationKV Caching

  32. Small Frequency Corrections Can Change What Survives KV Cache Compression

    Aug 27, 2026Hong Chen, Yudong Zeng, Yongwei Huang +5KV CachingKV-Cache Eviction

  33. StepKV: Step-Aware KV Cache Compression for LLM Agents

    Aug 26, 2026Boyu Feng, Jiahong Liu, Yifan Li +7KV CachingKV-Cache Compression

  34. Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

    Aug 20, 2026Matthias Seeger, Zeyu Zhang, Vihang Patil +2Fine-TuningKV Caching

  35. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

    Aug 9, 2026Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1Efficient Multimodal InferenceAudio Token Compression

  36. RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation

    Aug 9, 2026Dongjie Xu, Kai Qian, Julius +6KV CachingKV-Cache Management

  37. CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents

    Aug 8, 2026Weizhong Huang, Jinchao Zhang, Xiawu ZhengKV CachingLLM Agent Memory

  38. Runtime Observability for Heterogeneous Attention Memory

    Aug 6, 2026Fanzhe Wei, Li Liu, Ziyang Wang +1KV CachingLLM Auditing

  39. Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

    Aug 5, 2026Qiyuan Zhu, Dezhi Li, Pengyu Cheng +8Overthinking in Language ModelsKV Caching

  40. TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

    Aug 4, 2026Wonpyo Park, Seung-won HwangLLM PruningKV Caching

  41. AnchorKV: Anchor-Residual KV Cache Compression

    Aug 3, 2026Malik Khalaf, Yara Shamshoum, Nitzan Hodos +2KV CachingLong-Context Language Model Inference

  42. Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

    Aug 3, 2026Mengting Ai, Jingrui He, Yue GuoCoT FaithfulnessReasoning Evaluation

  43. RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction

    Aug 2, 2026Changwoo Baek, Seungjun Shin, Kyeongbo KongKV CachingMemory-Efficient Optimization