LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 246

All topics
CardsList
  1. WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points

    May 17, 2026Dongyue Li, Zechun Liu, Kai Yi +6LLM QuantizationQuantization-Aware Training

  2. Measuring Maximum Activations in Open Large Language Models

    May 15, 2026Luxuan Chen, Han Tian, Xinran Chen +9LLM QuantizationActivation Outliers

  3. Widening the Gap: Exploiting LLM Quantization via Outlier Injection

    May 14, 2026Xiaohua Zhan, Kazuki Egashira, Robin Staab +2LLM QuantizationLLM Backdoor Attacks

  4. High-Rate Quantized Matrix Multiplication II

    May 13, 2026Or Ordentlich, Yury PolyanskiyLLM QuantizationRate-Distortion Theory

  5. Grid Games: The Power of Multiple Grids for Quantizing Large Language Models

    May 12, 2026Vage Egiazarian, Erik Schultheis, Andrei Panferov +3LLM Quantization4-Bit Quantization

  6. SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

    May 12, 2026Chengzhu Bao, Xianglong Yan, Zhiteng Li +3LLM Quantization4-Bit Quantization

  7. PRISM: A Geometric Risk Bound for Decomposing Drift into Scale, Shape, and Head

    May 12, 2026Chieh-Yen Lin, Shao-Hua SunLLM QuantizationLLM Evaluation

  8. Efficient LLM-based Advertising via Model Compression and Parallel Verification

    May 12, 2026Wenxin Dong, Chang Gao, Guanghui Yu +9LLM QuantizationLLM Compression

  9. ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

    May 11, 2026Ryan Lucas, Mehdi Makni, Xiang Meng +2LLM QuantizationAlternating Direction Method of Multipliers

  10. Theory-optimal Quantization Based on Flatness

    May 11, 2026Xiusheng Huang, Zhe Li, Xuanwu Yin +5LLM QuantizationActivation Quantization

  11. Pretraining large language models with MXFP4 on Native FP4 Hardware

    May 11, 2026Musa Cim, Poovaiah Palangappa, Miro Hodak +3Language Model PretrainingLLM Quantization

  12. Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

    May 9, 2026Yuzhuang Xu, Xu Han, Yuxuan Li +2LLM QuantizationPost-Training Quantization

  13. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization

  14. Finer is Better (with the Right Scaling)

    May 8, 2026Clemens Schaefer, Gil TabakLLM Quantization4-Bit Quantization

  15. Normalized Architectures are Natively 4-Bit

    May 7, 2026Maxim Fishman, Brian Chmiel, Ron Banner +2LLM QuantizationNeural Representation Geometry

  16. Saliency-Aware Regularized Quantization Calibration for Large Language Models

    May 7, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationLanguage Model Calibration

  17. OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

    May 6, 2026Zhikai Li, Zhen Dong, Xuewen Liu +2LLM QuantizationWeight-Only Quantization

  18. QuIDE: Mastering the Quantized Intelligence Trade-off via Active Optimization

    May 5, 2026Xiantao JiangMixed-Precision QuantizationLLM Quantization

  19. Statistically-Lossless Quantization of Large Language Models

    May 4, 2026Michael Helcig, Eldar Kurtic, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  20. AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

    May 1, 2026Wenxiang Lin, Juntao Huang, Luhan Zhang +5LLM QuantizationCommunication-Efficient Distributed Training

  21. Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

    Apr 30, 2026YiFeng Wang, Zhun Sun, Keisuke SakaguchiLLM QuantizationActivation Quantization

  22. CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

    Apr 29, 2026Zhe Ding, Su Pan, Duowei PanMixed-Precision QuantizationLLM Quantization

  23. BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

    Apr 27, 2026Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan +3LLM QuantizationRL for Language Models

  24. Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels

    Apr 27, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaLLM QuantizationActivation Outliers

  25. QuantClaw: Precision Where It Matters for OpenClaw

    Apr 24, 2026Manyi Zhang, Ji-Fu Li, Zhongao Sun +5Mixed-Precision QuantizationLLM Quantization

  26. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2LLM Inference EfficiencyMixed-Precision Quantization

  27. From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization

    Apr 21, 2026Chenxi Zhou, Pengfei Cao, Jiang Li +4LLM QuantizationPost-Training Quantization

  28. LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation

    Apr 21, 2026Siqing Song, Chuang Wang, Yong Lang +2LLM QuantizationActivation Quantization

  29. GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling

    Apr 20, 2026Alireza Dadgarnia, Soroush Tabesh, Mahdi Nikdan +4LLM QuantizationPost-Training Quantization

  30. DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization

    Apr 20, 2026Haokun Lin, Xinle Jia, Haobo Xu +7LLM Quantization4-Bit Quantization

  31. D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation

    Apr 18, 2026Junlin Li, Shuangyong Song, Guodong Du +6LLM QuantizationLLM Compression

  32. When Flat Minima Fail: Characterizing INT4 Quantization Collapse After FP32 Convergence

    Apr 16, 2026Marcus ArmstrongLLM Quantization4-Bit Quantization

  33. Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate

    Apr 15, 2026Jaemin Kim, Sungkyun Kim, Junyeol Lee +1LLM QuantizationLanguage Model Calibration

  34. Leech Lattice Vector Quantization for Efficient LLM Compression

    Mar 11, 2026Tycho F. A. van der Ouderaa, Mart van Baalen, Paul Whatmough +1LLM QuantizationLLM Compression

  35. Dissecting Quantization Error: A Concentration-Alignment Perspective

    Mar 4, 2026Marco Federici, Boris van Breugel, Paul Whatmough +1LLM Quantization4-Bit Quantization

  36. QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

    Feb 11, 2026Kanghyun Noh, Jinheon Choi, Yulhwa KimLLM QuantizationLLM Compression

  37. Investigating Social Bias Changes in Quantized Language Models

    Feb 5, 2026Stanley Z. Hua, Sanae Lotfi, Irene Y. ChenLLM QuantizationSocial Bias in Language Models

  38. MatGPTQ: Efficient and Accurate Inference over Nested Quantized Models

    Feb 3, 2026Maximilian Kleinegger, Elvir Crnčević, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  39. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  40. ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

    Jan 12, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +3LLM Quantization4-Bit Quantization

  41. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization

  42. LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

    Sep 28, 2025Shubhang Bhatnagar, Andy Xu, Kar-Han Tan +1Mixed-Precision QuantizationLLM Quantization

  43. On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs

    Sep 22, 2025Rongguang Ye, Ming Tang, Edith C. H. NgaiMixed-Precision QuantizationLLM Quantization

  44. Fair-GPTQ: Bias-Aware Quantization for Large Language Models

    Sep 18, 2025Irina Proskurina, Guillaume Metzler, Julien VelcinLLM QuantizationSocial Bias in Language Models

  45. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Mixed-Precision QuantizationLLM Quantization

  46. FPTQuant: Function-Preserving Transforms for LLM Quantization

    Jun 5, 2025Boris van Breugel, Yelysei Bondarenko, Paul Whatmough +1LLM QuantizationLLM Inference Acceleration