4-Bit Quantization

Latest papers 65

All topics
CardsList
  1. JustQuant: You Don't Need Smoothing, SVD, or Rotation for 4-Bit Activation Quantization

    Sep 27, 2026Kaicheng Yang, Kaisen Yang, Chunyu Liu +8Diffusion Model QuantizationQuantization-Aware Training

  2. PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

    Sep 27, 2026Yutong Wang, Xingtong Ge, Enhuai Liu +4Video Diffusion ModelsDiffusion Transformer

  3. Q-WAM: 4-Bit Quantization of World Action Models with Action-Subspace Protection

    Sep 27, 2026Arash Akbari, Arman Akbari, Jingwu Luo +7Mixed-Precision Quantization4-Bit Quantization

  4. Global Ranks Survive, Selected Heads Shift: BOS-Sink Topology under 4-bit Weight-Only Quantization

    Sep 20, 2026Kuanlin Chen, Chen-Wei Kuo, Cheng-En OuAttention Head Analysis4-Bit Quantization

  5. MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration

    Sep 17, 2026Yuan Liao, Jae-sun SeoAI Accelerator InferenceVLM Quantization

  6. NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space

    Aug 13, 2026Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas +14-Bit QuantizationHardware-Aware NAS

  7. Calibration Bets on the Past: Post-Training Quantization for Financial Time-Series Forecasting

    Aug 12, 2026Junyi Ye, Ivy Gateri WanjikuFinancial Forecasting4-Bit Quantization

  8. PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks

    Aug 7, 2026Hui Xie, Tong Shi, Haotong Qin +3Mixed-Precision Quantization4-Bit Quantization

  9. FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

    Aug 3, 2026Xianglong Yan, Hong Liu, Chengzhu Bao +4LLM Quantization4-Bit Quantization

  10. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  11. KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

    Jul 23, 2026Yann Bouquet, Alireza Khodamoradi, Kristof Denolf +1Diffusion TransformerDiffusion Model Quantization

  12. Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

    Jul 14, 2026Joshua HillMixed-Precision QuantizationLLM Quantization

  13. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

    Jul 5, 2026Siyu Ding, Mingchuan Ma, Jiabo Tong +3Language Model PretrainingMixed-Precision Quantization

  14. Logb\text{Log}_\text{b}Quant: Quantizing Language Models in Logarithmic Space

    Jul 1, 2026Jeremias Bohn, Tizian Dippold, Mahdi Koubaa +2LLM Quantization4-Bit Quantization

  15. RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

    Jul 1, 2026Yaofu Liu, Wanli Lan, Jinxi Li +2Mixed-Precision QuantizationRotary Positional Embeddings

  16. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

    Jun 25, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +44-Bit QuantizationLLM Inference Acceleration

  17. ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

    Jun 14, 2026Janghwan Lee, Sihwa Lee, Jinseok Kim +4LLM QuantizationQuantization-Aware Training

  18. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  19. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Mixed-Precision QuantizationLLM Quantization