4-Bit Quantization

Latest papers 65

All topics
CardsList
  1. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

    Jun 7, 2026Hong Guo, Nianhui Guo, Weixing Wang +3LLM QuantizationGPU Kernel Optimization

  2. Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization

    Jun 7, 2026Patrik Czakó, Gábor Kertész, Sándor SzénásiLLM Quantization4-Bit Quantization

  3. OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

    Jun 5, 2026Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang +2LLM Quantization4-Bit Quantization

  4. Characterizing the Impact of NVFP4 Quantization for Low-Power Edge AI Deployment

    Jun 3, 2026Ovishake Sen, Venkata Nithin Kamineni, Daniel Lobo +3Efficient Neural Network InferenceEdge Inference

  5. ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

    May 30, 2026Li Lin, Xiaojun WanLLM Quantization4-Bit Quantization

  6. Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

    May 26, 2026Junhao Wu, Dezhong Yao, Hai JinVideo Diffusion ModelsDiffusion Transformer

  7. Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

    May 26, 2026Zhanfeng Feng, Shuai Guo, Xin Di +3Video Diffusion Models4-Bit Quantization

  8. Pre-Registering the Detectable Effect: A Paired-MDE Budget for 4-bit Quantization Benchmarks, with a Pilot Audit

    May 25, 2026Zexin Zhuang, Yanhang Li, Zhichao FanLLM QuantizationStatistical Power Analysis

  9. CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model

    May 16, 2026Houji Wen, Jiangyong Yu, Jun Li +1Cross-Attention4-Bit Quantization

  10. E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight Anchoring

    May 16, 2026Wenjun Wang, Yanggan Gu, Shuo Cai +44-Bit QuantizationPost-Training Quantization

  11. DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

    May 16, 2026Sayeh Sharify, Mahsa Salmani, Hesham MostafaDiffusion TransformerDiffusion Model Quantization

  12. Search Your Block Floating Point Scales!

    May 12, 2026Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu +104-Bit QuantizationLLM Inference Acceleration

  13. Grid Games: The Power of Multiple Grids for Quantizing Large Language Models

    May 12, 2026Vage Egiazarian, Erik Schultheis, Andrei Panferov +3LLM Quantization4-Bit Quantization

  14. SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

    May 12, 2026Chengzhu Bao, Xianglong Yan, Zhiteng Li +3LLM Quantization4-Bit Quantization

  15. MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization

    May 12, 2026Yupeng Su, Ruijie Zhang, Ziyue Liu +24-Bit QuantizationMuon Optimizer

  16. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization

  17. Finer is Better (with the Right Scaling)

    May 8, 2026Clemens Schaefer, Gil TabakLLM Quantization4-Bit Quantization

  18. Direction-Preserving Number Representations

    May 8, 2026Bardia Zadeh, George A. Constantinides4-Bit QuantizationLow-Bit Quantization

  19. Normalized Architectures are Natively 4-Bit

    May 7, 2026Maxim Fishman, Brian Chmiel, Ron Banner +2LLM QuantizationNeural Representation Geometry

  20. LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

    Apr 20, 2026Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen +2Mixed-Precision QuantizationDiffusion Transformer

  21. DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization

    Apr 20, 2026Haokun Lin, Xinle Jia, Haobo Xu +7LLM Quantization4-Bit Quantization

  22. When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization

    Apr 18, 2026Tianqi Li, Wenyu Fang, Xin He +34-Bit QuantizationActivation Quantization