Low-Bit Quantization

Momentum

21 papers in the last four weeks, up 62% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 155

All topics
CardsList
  1. Contextual Bandits for Resource-Constrained Devices using Probabilistic Learning

    May 13, 2026Marco Angioli, Kevin Johansson, Antonello Rosato +2Hyperdimensional ComputingContextual Bandits

  2. MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization

    May 12, 2026Yupeng Su, Ruijie Zhang, Ziyue Liu +24-Bit QuantizationMuon Optimizer

  3. ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

    May 11, 2026Ryan Lucas, Mehdi Makni, Xiang Meng +2LLM QuantizationAlternating Direction Method of Multipliers

  4. Theory-optimal Quantization Based on Flatness

    May 11, 2026Xiusheng Huang, Zhe Li, Xuanwu Yin +5LLM QuantizationActivation Quantization

  5. PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models

    May 10, 2026Yongsen Cheng, Kai Liu, Kaiwen Tao +5Diffusion Model QuantizationPost-Training Quantization

  6. Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

    May 9, 2026Yuzhuang Xu, Xu Han, Yuxuan Li +2LLM QuantizationPost-Training Quantization

  7. Finer is Better (with the Right Scaling)

    May 8, 2026Clemens Schaefer, Gil TabakLLM Quantization4-Bit Quantization

  8. Direction-Preserving Number Representations

    May 8, 2026Bardia Zadeh, George A. Constantinides4-Bit QuantizationLow-Bit Quantization

  9. LoopQ: Quantization for Recursive Transformers

    May 8, 2026Rui Fang, Hsi-Wen Chen, Ming-Syan ChenRecurrent TransformersLanguage Modeling

  10. OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

    May 6, 2026Zhikai Li, Zhen Dong, Xuewen Liu +2LLM QuantizationWeight-Only Quantization

  11. Statistically-Lossless Quantization of Large Language Models

    May 4, 2026Michael Helcig, Eldar Kurtic, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  12. Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay

    May 2, 2026Jin Tong, Guang Liang, Peilin Sun +1Vision TransformerActivation Outliers

  13. Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

    Apr 30, 2026YiFeng Wang, Zhun Sun, Keisuke SakaguchiLLM QuantizationActivation Quantization

  14. CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

    Apr 29, 2026Zhe Ding, Su Pan, Duowei PanMixed-Precision QuantizationLLM Quantization

  15. QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention

    Apr 28, 2026Sehyeon Oh, Yongin Kwon, Jemin LeeSoftmax AttentionGPU Acceleration

  16. BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

    Apr 27, 2026Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan +3LLM QuantizationRL for Language Models

  17. Efficient INT8 Single-Image Super-Resolution via Deployment-Aware Quantization and Teacher-Guided Training

    Apr 22, 2026Pham Phuong Nam Nguyen, Nam Tien Le, Thi Kim Trang Vo +1Efficient Neural Network InferenceQuantization-Aware Training

  18. From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization

    Apr 21, 2026Chenxi Zhou, Pengfei Cao, Jiang Li +4LLM QuantizationPost-Training Quantization

  19. Revisiting RaBitQ and TurboQuant: A Symmetric Comparison of Methods, Theory, and Experiments

    Apr 21, 2026Jianyang Gao, Yutong Gou, Yuexuan Xu +5Vector QuantizationKV-Cache Quantization

  20. LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation

    Apr 21, 2026Siqing Song, Chuang Wang, Yong Lang +2LLM QuantizationActivation Quantization

  21. GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling

    Apr 20, 2026Alireza Dadgarnia, Soroush Tabesh, Mahdi Nikdan +4LLM QuantizationPost-Training Quantization

  22. A Note on TurboQuant and the Earlier DRIVE/EDEN Line of Work

    Apr 20, 2026Ran Ben-Basat, Yaniv Ben-Itzhak, Gal Mendelson +3Residual VQVector Quantization

  23. Towards Joint Quantization and Token Pruning of Vision-Language Models

    Apr 19, 2026Xinqing Li, Xin He, Xindong Zhang +3Vision-Language ModelsVLM Quantization

  24. Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate

    Apr 15, 2026Jaemin Kim, Sungkyun Kim, Junyeol Lee +1LLM QuantizationLanguage Model Calibration

  25. MatGPTQ: Efficient and Accurate Inference over Nested Quantized Models

    Feb 3, 2026Maximilian Kleinegger, Elvir Crnčević, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  26. QuantKAN: A Unified Quantization Framework for Kolmogorov Arnold Networks

    Nov 24, 2025Kazi Ahmed Asif Fuad, Lizhong ChenQuantization-Aware TrainingKolmogorov-Arnold Networks

  27. Activation Quantization of Vision Encoders Needs Prefixing Registers

    Oct 6, 2025Seunghyeon Kim, Taesun Yeom, Jinho Kim +3Activation OutliersActivation Quantization