LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 246

All topics
CardsList
  1. Align, Then Correct: Training-Free Two-Stage Low-Rank Compensation for Extremely Quantized Large Language Models

    Oct 6, 2026Seobin Song, Geonho Lee, Janghwan Lee +1LLM QuantizationPost-Training Quantization

  2. ApexQuant: Data-Free Elastic Quantization by Residual Re-Isotropization

    Oct 6, 2026Aksel Fristrup, Sumit Pandey, Ankit KariryaaLLM QuantizationRotation-Based Quantization

  3. TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

    Oct 6, 2026Xin Wang, Hao Yu, Zhengyang Zhuge +9LLM QuantizationQuantization-Aware Training

  4. Activation Denoising: A Robustness View on Parallel vs Sequential LLM Quantization

    Oct 5, 2026Yan Scholten, Rachel Lawrence, James Hensman +3LLM QuantizationPost-Training Quantization

  5. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

    Oct 5, 2026Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4Mixed-Precision QuantizationLLM Quantization

  6. Understanding the Weight Averaging Mechanism in LLM Training for Post-Training Quantization

    Oct 4, 2026Hanzhang Wang, Tianqi Shen, Zonglin Liu +3LLM QuantizationPost-Training Quantization

  7. Loopy: Low-Bit Quantization Framework for Looped Language Models

    Oct 4, 2026Zeyu LI, Yipu ZHANG, Jintao Chen +2LLM QuantizationPost-Training Quantization

  8. XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization

    Sep 30, 2026Xiaofan Que, Nir Elkayam, Spandan Pyakurel +2LLM QuantizationLLM Inference Acceleration

  9. QATFactory: A Versatile, Deployment-Aligned Framework for Quantization-aware Training and Distillation of LLMs

    Sep 30, 2026Weili Xu, Jisen Li, Yuqing Jian +8LLM QuantizationQuantization-Aware Training

  10. JARQ: Joint Alternating Refinement for Quantization

    Sep 29, 2026Xinyu Wang, Sicheng Lyu, Xiao-Wen ChangLLM QuantizationWeight-Only Quantization

  11. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2LLM QuantizationWeight-Only Quantization

  12. Security-Enhanced Seed-Based Weight Quantization for Large Language Models

    Sep 29, 2026Qiuyu Ren, Sudipta Paria, Aritra Dasgupta +1LLM QuantizationLLM Compression

  13. STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

    Sep 29, 2026Bingchen Yao, Haobo Xu, Haokun Lin +6LLM QuantizationLLM Inference Acceleration

  14. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Sep 29, 2026Yi Pan, Haocheng Xi, Kan Zhu +10LLM QuantizationLLM Inference Acceleration

  15. Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models

    Sep 29, 2026Wenxiao Fan, Jingling Fu, Lichen Ma +6LLM QuantizationVLM Quantization

  16. Bits Under ZK-LLM: Evaluating Zero-Knowledge-Friendly Quantization for Verifiable Private LLM Inference

    Sep 29, 2026Taeung Yoon, Yupeng Zhang, Xiaojing LiaoLLM QuantizationLLM Inference

  17. ThinQuant: Scalable Rotation Learning for Weight and Activation Quantization of LLMs

    Sep 28, 2026Mehdi Makni, Ryan Lucas, Rahul MazumderLLM QuantizationRotation-Based Quantization

  18. IMC-CLINIC: Coupled Loss-Informed Newton Iterations for Clipping in Analog In-Memory Computing

    Sep 28, 2026Yung-Chin Chen, Chia-Yu Chen, Naveen VermaLLM QuantizationCompute-in-Memory

  19. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Mixed-Precision QuantizationLLM Quantization

  20. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4LLM QuantizationSpiking Neural Networks

  21. Softmax Reparameterization for Output-Head Quantization

    Sep 25, 2026Asim Kadav, Christian Flores, Chirag Arora +5LLM QuantizationPost-Training Quantization

  22. Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning

    Sep 22, 2026Yuanteng Chen, Zhilei Liu, Peisong Wang +7LLM QuantizationQuantization-Aware Training

  23. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2LLM QuantizationLLM Inference

  24. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  25. A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

    Sep 16, 2026Jerry KaplanLLM QuantizationLLM Evaluation

  26. LLM Inference in a Flash!

    Sep 14, 2026Sebastian Zhao, Minseo Kim, Coleman Hooper +5LLM QuantizationCompute-in-Memory

  27. Structured Transforms for Low-Overhead Quantization of Language Models

    Sep 11, 2026Daria Cherniuk, Alexander Rudikov, Boris Kashin +1LLM QuantizationWeight-Only Quantization

  28. Why Does Post-Training Quantization Work?

    Sep 10, 2026Yuxiang Chen, Michael Beyer, Jun Zhu +1LLM QuantizationPost-Training Quantization

  29. Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs

    Sep 1, 2026Jainil Dharmil ShahLLM QuantizationLLM Evaluation

  30. HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

    Aug 31, 2026Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6LLM QuantizationLLM Inference Acceleration

  31. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationLLM Quantization

  32. A Target-Centric Survey of Quantization-Aware Training

    Aug 30, 2026Jiamin Song, Mengjie Zhao, Zijing Wang +6LLM QuantizationQuantization-Aware Training

  33. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  34. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization

  35. When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

    Aug 26, 2026Yao Fu, Lijia Huang, Xiaomin Li +3LLM QuantizationLLM Interpretability

  36. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  37. Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

    Aug 24, 2026Zehao Liu, Chuangchuang Fang, Yang RenLLM QuantizationWeight-Only Quantization

  38. In-Cell Learning: Language Models That Update Their Own Weights in Sequence Without Changing the File They Ship

    Aug 21, 2026Zifeng Liu, Yaxin Lu, Xuanhan Wu +6LLM QuantizationKnowledge Editing

  39. QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction

    Aug 14, 2026Vincent Counathe, Ben Athiwaratkun, Christopher De Sa +1LLM QuantizationQuantization-Aware Training

  40. SoftWater: Class-Aware Rate Allocation for Softmax Quantization

    Aug 12, 2026Joao V. Cavalcanti, Ashia C. WilsonLLM QuantizationPost-Training Quantization