LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Mixed-Precision QuantizationLLM Quantization

  2. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4LLM QuantizationSpiking Neural Networks

  3. Softmax Reparameterization for Output-Head Quantization

    Sep 25, 2026Asim Kadav, Christian Flores, Chirag Arora +5LLM QuantizationPost-Training Quantization

  4. Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning

    Sep 22, 2026Yuanteng Chen, Zhilei Liu, Peisong Wang +7LLM QuantizationQuantization-Aware Training

  5. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2LLM QuantizationLLM Inference

  6. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  7. A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

    Sep 16, 2026Jerry KaplanLLM QuantizationLLM Evaluation

  8. LLM Inference in a Flash!

    Sep 14, 2026Sebastian Zhao, Minseo Kim, Coleman Hooper +5LLM QuantizationCompute-in-Memory

  9. Structured Transforms for Low-Overhead Quantization of Language Models

    Sep 11, 2026Daria Cherniuk, Alexander Rudikov, Boris Kashin +1LLM QuantizationWeight-Only Quantization

  10. Why Does Post-Training Quantization Work?

    Sep 10, 2026Yuxiang Chen, Michael Beyer, Jun Zhu +1LLM QuantizationPost-Training Quantization

  11. Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs

    Sep 1, 2026Jainil Dharmil ShahLLM QuantizationLLM Evaluation

  12. HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

    Aug 31, 2026Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6LLM QuantizationLLM Inference Acceleration

  13. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationLLM Quantization

  14. A Target-Centric Survey of Quantization-Aware Training

    Aug 30, 2026Jiamin Song, Mengjie Zhao, Zijing Wang +6LLM QuantizationQuantization-Aware Training

  15. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  16. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization

  17. When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

    Aug 26, 2026Yao Fu, Lijia Huang, Xiaomin Li +3LLM QuantizationLLM Interpretability

  18. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  19. Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

    Aug 24, 2026Zehao Liu, Chuangchuang Fang, Yang RenLLM QuantizationWeight-Only Quantization