4-Bit Quantization

Latest papers 65

All topics
CardsList
  1. JustQuant: You Don't Need Smoothing, SVD, or Rotation for 4-Bit Activation Quantization

    Sep 27, 2026Kaicheng Yang, Kaisen Yang, Chunyu Liu +8Diffusion Model QuantizationQuantization-Aware Training

  2. PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

    Sep 27, 2026Yutong Wang, Xingtong Ge, Enhuai Liu +4Video Diffusion ModelsDiffusion Transformer

  3. Q-WAM: 4-Bit Quantization of World Action Models with Action-Subspace Protection

    Sep 27, 2026Arash Akbari, Arman Akbari, Jingwu Luo +7Mixed-Precision Quantization4-Bit Quantization

  4. Global Ranks Survive, Selected Heads Shift: BOS-Sink Topology under 4-bit Weight-Only Quantization

    Sep 20, 2026Kuanlin Chen, Chen-Wei Kuo, Cheng-En OuAttention Head Analysis4-Bit Quantization

  5. MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration

    Sep 17, 2026Yuan Liao, Jae-sun SeoAI Accelerator InferenceVLM Quantization

  6. NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space

    Aug 13, 2026Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas +14-Bit QuantizationHardware-Aware NAS

  7. Calibration Bets on the Past: Post-Training Quantization for Financial Time-Series Forecasting

    Aug 12, 2026Junyi Ye, Ivy Gateri WanjikuFinancial Forecasting4-Bit Quantization

  8. PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks

    Aug 7, 2026Hui Xie, Tong Shi, Haotong Qin +3Mixed-Precision Quantization4-Bit Quantization

  9. FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

    Aug 3, 2026Xianglong Yan, Hong Liu, Chengzhu Bao +4LLM Quantization4-Bit Quantization

  10. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  11. KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

    Jul 23, 2026Yann Bouquet, Alireza Khodamoradi, Kristof Denolf +1Diffusion TransformerDiffusion Model Quantization

  12. Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

    Jul 14, 2026Joshua HillMixed-Precision QuantizationLLM Quantization

  13. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

    Jul 5, 2026Siyu Ding, Mingchuan Ma, Jiabo Tong +3Language Model PretrainingMixed-Precision Quantization

  14. Logb\text{Log}_\text{b}Quant: Quantizing Language Models in Logarithmic Space

    Jul 1, 2026Jeremias Bohn, Tizian Dippold, Mahdi Koubaa +2LLM Quantization4-Bit Quantization

  15. RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

    Jul 1, 2026Yaofu Liu, Wanli Lan, Jinxi Li +2Mixed-Precision QuantizationRotary Positional Embeddings

  16. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

    Jun 25, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +44-Bit QuantizationLLM Inference Acceleration

  17. ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

    Jun 14, 2026Janghwan Lee, Sihwa Lee, Jinseok Kim +4LLM QuantizationQuantization-Aware Training

  18. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  19. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Mixed-Precision QuantizationLLM Quantization

  20. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

    Jun 7, 2026Hong Guo, Nianhui Guo, Weixing Wang +3LLM QuantizationGPU Kernel Optimization

  21. Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization

    Jun 7, 2026Patrik Czakó, Gábor Kertész, Sándor SzénásiLLM Quantization4-Bit Quantization

  22. OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

    Jun 5, 2026Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang +2LLM Quantization4-Bit Quantization

  23. Characterizing the Impact of NVFP4 Quantization for Low-Power Edge AI Deployment

    Jun 3, 2026Ovishake Sen, Venkata Nithin Kamineni, Daniel Lobo +3Efficient Neural Network InferenceEdge Inference

  24. ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

    May 30, 2026Li Lin, Xiaojun WanLLM Quantization4-Bit Quantization

  25. Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

    May 26, 2026Junhao Wu, Dezhong Yao, Hai JinVideo Diffusion ModelsDiffusion Transformer

  26. Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

    May 26, 2026Zhanfeng Feng, Shuai Guo, Xin Di +3Video Diffusion Models4-Bit Quantization

  27. Pre-Registering the Detectable Effect: A Paired-MDE Budget for 4-bit Quantization Benchmarks, with a Pilot Audit

    May 25, 2026Zexin Zhuang, Yanhang Li, Zhichao FanLLM QuantizationStatistical Power Analysis

  28. CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model

    May 16, 2026Houji Wen, Jiangyong Yu, Jun Li +1Cross-Attention4-Bit Quantization

  29. E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight Anchoring

    May 16, 2026Wenjun Wang, Yanggan Gu, Shuo Cai +44-Bit QuantizationPost-Training Quantization

  30. DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

    May 16, 2026Sayeh Sharify, Mahsa Salmani, Hesham MostafaDiffusion TransformerDiffusion Model Quantization

  31. Search Your Block Floating Point Scales!

    May 12, 2026Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu +104-Bit QuantizationLLM Inference Acceleration

  32. Grid Games: The Power of Multiple Grids for Quantizing Large Language Models

    May 12, 2026Vage Egiazarian, Erik Schultheis, Andrei Panferov +3LLM Quantization4-Bit Quantization

  33. SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

    May 12, 2026Chengzhu Bao, Xianglong Yan, Zhiteng Li +3LLM Quantization4-Bit Quantization

  34. MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization

    May 12, 2026Yupeng Su, Ruijie Zhang, Ziyue Liu +24-Bit QuantizationMuon Optimizer

  35. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization

  36. Finer is Better (with the Right Scaling)

    May 8, 2026Clemens Schaefer, Gil TabakLLM Quantization4-Bit Quantization

  37. Direction-Preserving Number Representations

    May 8, 2026Bardia Zadeh, George A. Constantinides4-Bit QuantizationLow-Bit Quantization

  38. Normalized Architectures are Natively 4-Bit

    May 7, 2026Maxim Fishman, Brian Chmiel, Ron Banner +2LLM QuantizationNeural Representation Geometry

  39. LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

    Apr 20, 2026Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen +2Mixed-Precision QuantizationDiffusion Transformer

  40. DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization

    Apr 20, 2026Haokun Lin, Xinle Jia, Haobo Xu +7LLM Quantization4-Bit Quantization

  41. When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization

    Apr 18, 2026Tianqi Li, Wenyu Fang, Xin He +34-Bit QuantizationActivation Quantization