Key-Value Cache Quantization

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 44

All topics
CardsList
  1. Shared Stopping Decisions Change Answers in HQQ Cache Quantization

    Oct 5, 2026Seunghui Jwa, Minsu Oh, Chanjun Park +1Key-Value Cache Quantization

  2. QuantMLA: Function-Aligned Dual-Path Quantization for Low-Bit MLA KV Caching

    Sep 29, 2026Zunhai Su, Yuxuan Sun, Jianchao Tan +5Key-Value Cache QuantizationMulti-Head Attention

  3. PQ-HSA: Reusing Product-Quantized Scores for Hybrid Sparse-Approximate Attention

    Sep 27, 2026Kunming Shao, Jierun Chen, Yanli Wang +4Dynamic Sparse AttentionKey-Value Cache Quantization

  4. QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models

    Sep 22, 2026Jiaqi Zhao, Xiaobin Hu, Bo Yin +3Key-Value Cache QuantizationQantis

  5. Attention Quantization for Tabular Foundation Models

    Sep 14, 2026Jonas M. Kübler, Benjamin Jäger, Klemens Flöge +2Tabular Foundation ModelsKey-Value Cache Quantization

  6. OmniKVQuant: KV Cache Quantization for Omni-LLMs

    Sep 11, 2026Suho Yoo, Hyunjong Ok, Jongmin Choi +2Key-Value Cache QuantizationCache

  7. Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation

    Aug 31, 2026Atta Ul Asad, Ahsan Bilal, Muhammad Ali +2Key-Value Cache QuantizationFaithfulness

  8. Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms

    Aug 4, 2026Samuel Fernández-Menduiña, Amir Ziashahabi, Eduardo Pavez +2Key-Value Cache QuantizationResidual Vector Quantization

  9. Output-Aware Rotation for INT2 KV-Cache Quantization

    Aug 3, 2026Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong +4Key-Value Cache QuantizationKv-Cache Management

  10. Regularize or Localize: When Training-Time KV-Cache Geometry Pays Under Quantization

    Jul 19, 2026Libo Sun, Po-Wei Harn, Zewei Zhang +2Key-Value Cache QuantizationRegularization

  11. TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation

    Jul 7, 2026Andrii Balashov, Olena PonomarovaKey-Value Cache QuantizationMixture-Of-Experts

  12. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

    Jul 2, 2026Wenchen Han, Gingfung Matthew Yeung, Marco Barletta +3Key-Value Cache QuantizationKey-Value Cache

  13. GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache

    Jul 1, 2026Soosung Kim, Minjae Park, Eui-Young Chung +1Key-Value Cache QuantizationKey-Value Cache

  14. RoPE-Aware Bit Allocation for KV-Cache Quantization

    Jun 23, 2026Fengfeng Liang, Yuechen Zhang, Jiaya JiaKey-Value Cache QuantizationPeak Memory

  15. QK-Normed MLA: QK normalization without full key caching

    Jun 15, 2026Yizhou Han, Yao Zhao, Jun Zhou +2Multi-Head AttentionBatch Normalization

  16. Do Transformers Need Three Projections? Systematic Study of QKV Variants

    Jun 1, 2026Ali Kayyam, Anusha Madan Gopal, M Anthony LewisKey-Value Cache QuantizationTransformer Architectures

  17. Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

    Jun 1, 2026Bruce Changlong Xu, Adarsh Kumarappan, Mu ZhouKey-Value Cache QuantizationLarge Language Model Quantization

  18. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +3Key-Value Cache QuantizationKey-Value Cache Compression

  19. OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

    May 19, 2026Zunhai Su, Rui Yang, Chao Zhang +11Key-Value Cache QuantizationKey-Value Cache Compression

  20. OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

    May 18, 2026Zhongzhu Zhou, Donglin Zhuang, Jisen Li +4Key-Value Cache QuantizationLarge Language Model Tool Use

  21. TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

    May 16, 2026Hanzhang Shen, Haoran Wu, Yiren Zhao +1Key-Value Cache QuantizationAgentic Inference

  22. WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization

    May 4, 2026Wei Tao, Xiaoyang Qu, Peiqiang Wang +4Key-Value Cache QuantizationQuantizer

  23. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2Key-Value Cache QuantizationKey-Value Cache

  24. Revisiting RaBitQ and TurboQuant: A Symmetric Comparison of Methods, Theory, and Experiments

    Apr 21, 2026Jianyang Gao, Yutong Gou, Yuexuan Xu +5Key-Value Cache QuantizationComparison

  25. ResidualKV: Residual-Based KV Cache Compression for Efficient Long-Context Inference

    Feb 8, 2026Jitai Hao, Qiang Huang, Yaowei Wang +2Efficient Long-Context InferenceKey-Value Cache Compression

  26. UltraQuant: 4-bit KV Caching for Context-Heavy Agents

    Date pendingInesh Chakrabarti, David Limpus, Aditi Ghai Rana +4Key-Value Cache QuantizationKey-Value Cache Compression