LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  2. ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

    Jun 14, 2026Janghwan Lee, Sihwa Lee, Jinseok Kim +4LLM QuantizationQuantization-Aware Training

  3. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  4. Signed Symmetric Quantization for Few-Bit Integers

    Jun 12, 2026Ian Colbert, Eashan Dash, Pablo Monteagudo-Lago +5LLM QuantizationWeight-Only Quantization

  5. ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

    Jun 11, 2026Sihwa Lee, Janghwan Lee, Donghoon Yoo +4LLM QuantizationLanguage Model Decoding

  6. TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

    Jun 11, 2026Zhixiong Zhao, Zukang Xu, Zhixuan Chen +3Mixed-Precision QuantizationLLM Quantization

  7. Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

    Jun 11, 2026Liza Babaoglu, Shuangyi Chen, Ashish KhistiLLM QuantizationWeight-Only Quantization

  8. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Mixed-Precision QuantizationLLM Quantization

  9. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Mixed-Precision QuantizationLLM Quantization

  10. UniSVQ: 2-bit Unified Scalar-Vector Quantization

    Jun 9, 2026Haoyu Wang, Haiyan Zhao, Xingyu Yu +4LLM QuantizationVector Quantization

  11. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

    Jun 7, 2026Hong Guo, Nianhui Guo, Weixing Wang +3LLM QuantizationGPU Kernel Optimization

  12. Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization

    Jun 7, 2026Patrik Czakó, Gábor Kertész, Sándor SzénásiLLM Quantization4-Bit Quantization

  13. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

    Jun 5, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  14. OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

    Jun 5, 2026Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang +2LLM Quantization4-Bit Quantization

  15. SPEAR: A System for Post-Quantization Error-Adaptive Recovery Enabling Efficient Low-Bit LLM Serving

    Jun 4, 2026Hongyuan Liu, Yawei Li, Zhiqiang Que +3LLM QuantizationLLM Serving

  16. LLMCodec: Adapting Video Codecs for Efficient Weight Compression of Large Language Models

    Jun 4, 2026Rui Wang, Yan Zhao, Li Song +1Model CompressionLLM Quantization

  17. FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

    Jun 4, 2026Haoyu Huang, Linlin Yang, Sheng Xu +5LLM QuantizationDiffusion Model Quantization

  18. STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models

    Jun 3, 2026Xin Yan, Aqiang Wang, Zhenglin Wan +2LLM QuantizationDiffusion Model Quantization

  19. QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy

    Jun 3, 2026Pasindu Wickramasinghe, Achyuta Muthuvelan, Rachmad Vidya Wicaksana Putra +2Mixed-Precision QuantizationLLM Quantization

  20. LLM Compression with Jointly Optimizing Architectural and Quantization choices

    Jun 2, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  21. LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

    Jun 2, 2026Liulu He, XuanAng Liu, Juntao Liu +8LLM QuantizationLLM Compression