Weight-Only Quantization

Latest papers 55

All topics
CardsList
  1. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Mixed-Precision QuantizationLLM Quantization

  2. Boundary-Aware Quantization: Finite-Scale Decision Geometry of Neural Classifiers

    Jul 1, 2026O. M. KiselevWeight-Only QuantizationPost-Training Quantization

  3. Spectral Perturbation of the Empirical Fisher Information Matrix under Weight Quantization

    Jun 26, 2026Rahid Zahid Alekberli, Hikmat KarimovInformation GeometryWeight-Only Quantization

  4. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  5. On the Expressive Power of Weight Quantization in Large Language Models

    Jun 20, 2026Shao-Qun ZhangLLM QuantizationWeight-Only Quantization

  6. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  7. Signed Symmetric Quantization for Few-Bit Integers

    Jun 12, 2026Ian Colbert, Eashan Dash, Pablo Monteagudo-Lago +5LLM QuantizationWeight-Only Quantization

  8. Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

    Jun 11, 2026Liza Babaoglu, Shuangyi Chen, Ashish KhistiLLM QuantizationWeight-Only Quantization

  9. LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

    Jun 2, 2026Liulu He, XuanAng Liu, Juntao Liu +8LLM QuantizationLLM Compression

  10. LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs

    May 28, 2026Jung Hyun Lee, June Yong Yang, Jungwook Choi +1LLM QuantizationWeight-Only Quantization

  11. BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices

    May 28, 2026Mincheol Kang, Hyunjin Lim, Bomin Kang +1Multi-Agent Trajectory PredictionWeight-Only Quantization

  12. QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

    May 25, 2026Preetam Sharma, Kacper DobekLLM QuantizationRotation-Based Quantization

  13. Motion-Compensated Weight Compression

    May 23, 2026Ismail LamaakalPredictive CodingWeight-Only Quantization

  14. High-Rate Quantized Matrix Multiplication II

    May 13, 2026Or Ordentlich, Yury PolyanskiyLLM QuantizationRate-Distortion Theory

  15. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization

  16. OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

    May 6, 2026Zhikai Li, Zhen Dong, Xuewen Liu +2LLM QuantizationWeight-Only Quantization

  17. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization

  18. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Mixed-Precision QuantizationLLM Quantization

  19. LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization

    Date pendingHaoyu Wang, Xingyu Yu, Haiyan Zhao +2LLM QuantizationQuantization-Aware Training