LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. Statistically-Lossless Quantization of Large Language Models

    May 4, 2026Michael Helcig, Eldar Kurtic, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  2. AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

    May 1, 2026Wenxiang Lin, Juntao Huang, Luhan Zhang +5LLM QuantizationCommunication-Efficient Distributed Training

  3. Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

    Apr 30, 2026YiFeng Wang, Zhun Sun, Keisuke SakaguchiLLM QuantizationActivation Quantization

  4. CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

    Apr 29, 2026Zhe Ding, Su Pan, Duowei PanMixed-Precision QuantizationLLM Quantization

  5. BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

    Apr 27, 2026Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan +3LLM QuantizationRL for Language Models

  6. Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels

    Apr 27, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaLLM QuantizationActivation Outliers

  7. QuantClaw: Precision Where It Matters for OpenClaw

    Apr 24, 2026Manyi Zhang, Ji-Fu Li, Zhongao Sun +5Mixed-Precision QuantizationLLM Quantization

  8. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2LLM Inference EfficiencyMixed-Precision Quantization

  9. From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization

    Apr 21, 2026Chenxi Zhou, Pengfei Cao, Jiang Li +4LLM QuantizationPost-Training Quantization

  10. LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation

    Apr 21, 2026Siqing Song, Chuang Wang, Yong Lang +2LLM QuantizationActivation Quantization

  11. GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling

    Apr 20, 2026Alireza Dadgarnia, Soroush Tabesh, Mahdi Nikdan +4LLM QuantizationPost-Training Quantization

  12. DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization

    Apr 20, 2026Haokun Lin, Xinle Jia, Haobo Xu +7LLM Quantization4-Bit Quantization

  13. D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation

    Apr 18, 2026Junlin Li, Shuangyong Song, Guodong Du +6LLM QuantizationLLM Compression

  14. When Flat Minima Fail: Characterizing INT4 Quantization Collapse After FP32 Convergence

    Apr 16, 2026Marcus ArmstrongLLM Quantization4-Bit Quantization

  15. Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate

    Apr 15, 2026Jaemin Kim, Sungkyun Kim, Junyeol Lee +1LLM QuantizationLanguage Model Calibration

  16. Leech Lattice Vector Quantization for Efficient LLM Compression

    Mar 11, 2026Tycho F. A. van der Ouderaa, Mart van Baalen, Paul Whatmough +1LLM QuantizationLLM Compression

  17. Dissecting Quantization Error: A Concentration-Alignment Perspective

    Mar 4, 2026Marco Federici, Boris van Breugel, Paul Whatmough +1LLM Quantization4-Bit Quantization

  18. QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

    Feb 11, 2026Kanghyun Noh, Jinheon Choi, Yulhwa KimLLM QuantizationLLM Compression

  19. Investigating Social Bias Changes in Quantized Language Models

    Feb 5, 2026Stanley Z. Hua, Sanae Lotfi, Irene Y. ChenLLM QuantizationSocial Bias in Language Models

  20. MatGPTQ: Efficient and Accurate Inference over Nested Quantized Models

    Feb 3, 2026Maximilian Kleinegger, Elvir Crnčević, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  21. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  22. ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

    Jan 12, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +3LLM Quantization4-Bit Quantization

  23. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization