LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. Quantize with Confidence? An Empirical Study of Quantization for Code Generation

    Jul 15, 2026Saima Afrin, Md. Zahidul Haque, Antonio MastropaoloLLM QuantizationCode Generation Evaluation

  2. Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

    Jul 14, 2026Joshua HillMixed-Precision QuantizationLLM Quantization

  3. Reliability Scaling Laws for Quantized Large Language Models

    Jul 12, 2026Sirine Ayadi, Sándor Daróczi, Stephan Günnemann +1LLM QuantizationLanguage Model Calibration

  4. Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

    Jul 10, 2026Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry WuLLM QuantizationLLM Evaluation

  5. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Mixed-Precision QuantizationLLM Quantization

  6. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

    Jul 5, 2026Siyu Ding, Mingchuan Ma, Jiabo Tong +3Language Model PretrainingMixed-Precision Quantization

  7. ELiTeFormer: An Efficient Transformer for FPGAs

    Jul 4, 2026Victor Agostinelli, Nicolas Bohm Agostini, Antonino TumeoLLM QuantizationTernary Quantization

  8. Logb\text{Log}_\text{b}Quant: Quantizing Language Models in Logarithmic Space

    Jul 1, 2026Jeremias Bohn, Tizian Dippold, Mahdi Koubaa +2LLM Quantization4-Bit Quantization

  9. Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

    Jul 1, 2026Fei Wang, Chao Xue, Taoran Liu +3Mixed-Precision QuantizationLLM Quantization

  10. FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

    Jun 27, 2026Aoying Zheng, Anqi Du, Zizhuang Deng +1LLM QuantizationLLM Backdoor Attacks

  11. CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

    Jun 25, 2026Shigeng Wang, Chao Li, Yangyuxuan Kang +2LLM QuantizationTernary Quantization

  12. BitNet Text Embeddings

    Jun 24, 2026Zhen Li, Xin Huang, Liang Wang +8LLM QuantizationEmbedding Compression

  13. Agentic evolution of physically constrained foundation models

    Jun 24, 2026Jiangwei Zhang, Wen Sun, Chong Wang +7Model CompressionLLM Quantization

  14. Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

    Jun 24, 2026Xinyu Lian, Walid Krichene, Beichen Huang +4LLM Inference EfficiencyLLM Quantization

  15. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  16. On the Expressive Power of Weight Quantization in Large Language Models

    Jun 20, 2026Shao-Qun ZhangLLM QuantizationWeight-Only Quantization

  17. Fast-TurboQuant: A Multiplier-Free Online Vector Quantization Approach

    Jun 19, 2026Pedro M. R. Pereira, Felipe A. P. de Figueiredo, Rausley A. A. de SouzaLLM QuantizationRotation-Based Quantization

  18. An Empirical Study of OpenPangu Quantization on Ascend NPUs

    Jun 19, 2026Tong Shi, Jiacheng Wang, Hui Xie +4LLM QuantizationAI Accelerator Inference

  19. Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

    Jun 17, 2026Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez +1LLM QuantizationLLM Evaluation

  20. Ternary Mamba: Grouped Quantization-Aware Training of W1.58A16 State Space Models

    Jun 16, 2026Ramprasath Ganesaraja, Sahil Dilip Panse, Swathika NLLM QuantizationTernary Quantization