LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization

    Jun 1, 2026Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou +1LLM QuantizationActivation Outliers

  2. Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

    Jun 1, 2026Ekaterina Alimaskina, Darya Rudas, Denis Shveykin +3LLM QuantizationEfficient Language Model Reasoning

  3. Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

    Jun 1, 2026Yujia Tong, Yuxi Wang, Yunyang Wan +3LLM QuantizationLLM Evaluation

  4. Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

    Jun 1, 2026Bruce Changlong Xu, Adarsh Kumarappan, Mu ZhouLLM QuantizationKV Caching

  5. GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation

    May 31, 2026Shihao Zhang, Rayan SaabLLM QuantizationLow-Rank Adaptation

  6. ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

    May 30, 2026Li Lin, Xiaojun WanLLM Quantization4-Bit Quantization

  7. ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression

    May 30, 2026Wenya Yu, Chao Zhang, Li Wang +2LLM QuantizationPost-Training Quantization

  8. HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

    May 28, 2026Artur Zagitov, Gleb Molodtsov, Aleksandr BeznosikovLLM QuantizationRotation-Based Quantization

  9. LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs

    May 28, 2026Jung Hyun Lee, June Yong Yang, Jungwook Choi +1LLM QuantizationWeight-Only Quantization

  10. Apertus LLM Family Expansion via Distillation and Quantization

    May 27, 2026Andrei Panferov, Davit Melikidze, Martin Jaggi +1LLM QuantizationLLM Compression

  11. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +3LLM QuantizationKV Caching

  12. WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization

    May 26, 2026Phong Nam Huu Nguyen, Khoi M. Le, Cong-Duy T Nguyen +3Mixed-Precision QuantizationLLM Quantization

  13. QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

    May 25, 2026Preetam Sharma, Kacper DobekLLM QuantizationRotation-Based Quantization

  14. GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization

    May 25, 2026Maoyang Xiang, Tao Luo, Bo WangLLM QuantizationEfficient Neural Network Inference

  15. Pre-Registering the Detectable Effect: A Paired-MDE Budget for 4-bit Quantization Benchmarks, with a Pilot Audit

    May 25, 2026Zexin Zhuang, Yanhang Li, Zhichao FanLLM QuantizationStatistical Power Analysis

  16. InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

    May 25, 2026Ke Li, Dong An, Xiaoling Zang +6LLM QuantizationActivation Quantization

  17. BitsMoE: Cost-Aware Bit Allocation in Spectral Space for MoE LLM Quantization

    May 22, 2026Jiayu Zhao, Zihan Teng, Minhao Fan +4Mixed-Precision QuantizationLLM Quantization

  18. Signs Beat Floats: Low-Rank Double-Binary Adaptation for On-Device Fine-Tuning

    May 22, 2026Yoshihiko Fujisawa, Yuma Ichikawa, Yudai Fujimoto +2LLM QuantizationMemory-Efficient Fine-Tuning

  19. GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

    May 21, 2026Jianing Deng, Song Wang, Dongwei Wang +4Mixed-Precision QuantizationLLM Quantization

  20. Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs

    May 19, 2026Haiquan Lu, Zigeng Chen, Gongfan Fang +2LLM QuantizationLong-Context Language Model Inference

  21. K-Quantization and its Impact on Output Performance

    May 19, 2026Robin Baki Davidsson, Pierre NuguesLLM QuantizationLLM Evaluation