LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

    May 18, 2026Zhangyang Yao, Haiyan Zhao, Haoyu Wang +3Mixed-Precision QuantizationLLM Quantization

  2. MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization

    May 18, 2026Le Su, Xing Luo, Zhi JinLLM QuantizationPost-Training Quantization

  3. Attention Sinks and Outliers in Attention Residuals

    May 18, 2026Haozheng Luo, Haoran Dai, Shaoyang Zhang +10LLM QuantizationAttention Residual Connections

  4. WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points

    May 17, 2026Dongyue Li, Zechun Liu, Kai Yi +6LLM QuantizationQuantization-Aware Training

  5. Measuring Maximum Activations in Open Large Language Models

    May 15, 2026Luxuan Chen, Han Tian, Xinran Chen +9LLM QuantizationActivation Outliers

  6. Widening the Gap: Exploiting LLM Quantization via Outlier Injection

    May 14, 2026Xiaohua Zhan, Kazuki Egashira, Robin Staab +2LLM QuantizationLLM Backdoor Attacks

  7. High-Rate Quantized Matrix Multiplication II

    May 13, 2026Or Ordentlich, Yury PolyanskiyLLM QuantizationRate-Distortion Theory

  8. Grid Games: The Power of Multiple Grids for Quantizing Large Language Models

    May 12, 2026Vage Egiazarian, Erik Schultheis, Andrei Panferov +3LLM Quantization4-Bit Quantization

  9. SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

    May 12, 2026Chengzhu Bao, Xianglong Yan, Zhiteng Li +3LLM Quantization4-Bit Quantization

  10. PRISM: A Geometric Risk Bound for Decomposing Drift into Scale, Shape, and Head

    May 12, 2026Chieh-Yen Lin, Shao-Hua SunLLM QuantizationLLM Evaluation

  11. Efficient LLM-based Advertising via Model Compression and Parallel Verification

    May 12, 2026Wenxin Dong, Chang Gao, Guanghui Yu +9LLM QuantizationLLM Compression

  12. ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

    May 11, 2026Ryan Lucas, Mehdi Makni, Xiang Meng +2LLM QuantizationAlternating Direction Method of Multipliers

  13. Theory-optimal Quantization Based on Flatness

    May 11, 2026Xiusheng Huang, Zhe Li, Xuanwu Yin +5LLM QuantizationActivation Quantization

  14. Pretraining large language models with MXFP4 on Native FP4 Hardware

    May 11, 2026Musa Cim, Poovaiah Palangappa, Miro Hodak +3Language Model PretrainingLLM Quantization

  15. Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

    May 9, 2026Yuzhuang Xu, Xu Han, Yuxuan Li +2LLM QuantizationPost-Training Quantization

  16. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization

  17. Finer is Better (with the Right Scaling)

    May 8, 2026Clemens Schaefer, Gil TabakLLM Quantization4-Bit Quantization

  18. Normalized Architectures are Natively 4-Bit

    May 7, 2026Maxim Fishman, Brian Chmiel, Ron Banner +2LLM QuantizationNeural Representation Geometry

  19. Saliency-Aware Regularized Quantization Calibration for Large Language Models

    May 7, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationLanguage Model Calibration

  20. OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

    May 6, 2026Zhikai Li, Zhen Dong, Xuewen Liu +2LLM QuantizationWeight-Only Quantization

  21. QuIDE: Mastering the Quantized Intelligence Trade-off via Active Optimization

    May 5, 2026Xiantao JiangMixed-Precision QuantizationLLM Quantization