LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization

    Oct 8, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationPost-Training Quantization

  2. OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models

    Oct 7, 2026Wenjun Wang, Heng Li, Yanggan Gu +1LLM QuantizationQuantization-Aware Training

  3. Few Bits, One Law: Toward W2A4KV2

    Oct 6, 2026Kai Yi, Tarek Elgamal, Sruthikesh Surineni +3LLM QuantizationLow-Bit Quantization

  4. Q-PACE: Dynamic Precision Allocation for Quantization-Aware Training

    Oct 6, 2026Alexandra Volkova, Matin Ansaripour, Erik Schultheis +2LLM QuantizationQuantization-Aware Training

  5. Align, Then Correct: Training-Free Two-Stage Low-Rank Compensation for Extremely Quantized Large Language Models

    Oct 6, 2026Seobin Song, Geonho Lee, Janghwan Lee +1LLM QuantizationPost-Training Quantization

  6. ApexQuant: Data-Free Elastic Quantization by Residual Re-Isotropization

    Oct 6, 2026Aksel Fristrup, Sumit Pandey, Ankit KariryaaLLM QuantizationRotation-Based Quantization

  7. TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

    Oct 6, 2026Xin Wang, Hao Yu, Zhengyang Zhuge +9LLM QuantizationQuantization-Aware Training

  8. Activation Denoising: A Robustness View on Parallel vs Sequential LLM Quantization

    Oct 5, 2026Yan Scholten, Rachel Lawrence, James Hensman +3LLM QuantizationPost-Training Quantization

  9. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

    Oct 5, 2026Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4Mixed-Precision QuantizationLLM Quantization

  10. Understanding the Weight Averaging Mechanism in LLM Training for Post-Training Quantization

    Oct 4, 2026Hanzhang Wang, Tianqi Shen, Zonglin Liu +3LLM QuantizationPost-Training Quantization

  11. Loopy: Low-Bit Quantization Framework for Looped Language Models

    Oct 4, 2026Zeyu LI, Yipu ZHANG, Jintao Chen +2LLM QuantizationPost-Training Quantization

  12. XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization

    Sep 30, 2026Xiaofan Que, Nir Elkayam, Spandan Pyakurel +2LLM QuantizationLLM Inference Acceleration

  13. QATFactory: A Versatile, Deployment-Aligned Framework for Quantization-aware Training and Distillation of LLMs

    Sep 30, 2026Weili Xu, Jisen Li, Yuqing Jian +8LLM QuantizationQuantization-Aware Training

  14. JARQ: Joint Alternating Refinement for Quantization

    Sep 29, 2026Xinyu Wang, Sicheng Lyu, Xiao-Wen ChangLLM QuantizationWeight-Only Quantization

  15. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2LLM QuantizationWeight-Only Quantization

  16. Security-Enhanced Seed-Based Weight Quantization for Large Language Models

    Sep 29, 2026Qiuyu Ren, Sudipta Paria, Aritra Dasgupta +1LLM QuantizationLLM Compression

  17. STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

    Sep 29, 2026Bingchen Yao, Haobo Xu, Haokun Lin +6LLM QuantizationLLM Inference Acceleration

  18. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Sep 29, 2026Yi Pan, Haocheng Xi, Kan Zhu +10LLM QuantizationLLM Inference Acceleration

  19. Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models

    Sep 29, 2026Wenxiao Fan, Jingling Fu, Lichen Ma +6LLM QuantizationVLM Quantization

  20. Bits Under ZK-LLM: Evaluating Zero-Knowledge-Friendly Quantization for Verifiable Private LLM Inference

    Sep 29, 2026Taeung Yoon, Yupeng Zhang, Xiaojing LiaoLLM QuantizationLLM Inference

  21. ThinQuant: Scalable Rotation Learning for Weight and Activation Quantization of LLMs

    Sep 28, 2026Mehdi Makni, Ryan Lucas, Rahul MazumderLLM QuantizationRotation-Based Quantization

  22. IMC-CLINIC: Coupled Loss-Informed Newton Iterations for Clipping in Analog In-Memory Computing

    Sep 28, 2026Yung-Chin Chen, Chia-Yu Chen, Naveen VermaLLM QuantizationCompute-in-Memory