Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers

    Jun 3, 2026Biao Qian, Yang Wang, Yong Wu +1Vision TransformerSynthetic Data Generation

  2. LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

    Jun 2, 2026Liulu He, XuanAng Liu, Juntao Liu +8LLM QuantizationLLM Compression

  3. GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation

    May 31, 2026Shihao Zhang, Rayan SaabLLM QuantizationLow-Rank Adaptation

  4. ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

    May 30, 2026Li Lin, Xiaojun WanLLM Quantization4-Bit Quantization

  5. ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression

    May 30, 2026Wenya Yu, Chao Zhang, Li Wang +2LLM QuantizationPost-Training Quantization

  6. HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

    May 28, 2026Artur Zagitov, Gleb Molodtsov, Aleksandr BeznosikovLLM QuantizationRotation-Based Quantization

  7. LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs

    May 28, 2026Jung Hyun Lee, June Yong Yang, Jungwook Choi +1LLM QuantizationWeight-Only Quantization

  8. The Complexity of Verifying Feedforward Neural Networks in Quantised Settings

    May 28, 2026Eric Alsmann, Martin Lange, Marco SälzerNeural Network VerificationFormal Verification

  9. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +3LLM QuantizationKV Caching

  10. Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

    May 26, 2026Junhao Wu, Dezhong Yao, Hai JinVideo Diffusion ModelsDiffusion Transformer

  11. WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization

    May 26, 2026Phong Nam Huu Nguyen, Khoi M. Le, Cong-Duy T Nguyen +3Mixed-Precision QuantizationLLM Quantization

  12. The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

    May 26, 2026Kahyeon Nam, Hyesong ChoiVLM QuantizationActivation Quantization

  13. GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization

    May 25, 2026Maoyang Xiang, Tao Luo, Bo WangLLM QuantizationEfficient Neural Network Inference

  14. InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

    May 25, 2026Ke Li, Dong An, Xiaoling Zang +6LLM QuantizationActivation Quantization

  15. MX-SAFE: Versatile Inference- and Training-Proof Microscaling Format with On-the-Fly Exponent and Mantissa Bit Allocation

    May 23, 2026Dahoon Park, Jahyun Koo, Sangwoo Hwang +1Mixed-Precision QuantizationAI Accelerator Inference

  16. BitsMoE: Cost-Aware Bit Allocation in Spectral Space for MoE LLM Quantization

    May 22, 2026Jiayu Zhao, Zihan Teng, Minhao Fan +4Mixed-Precision QuantizationLLM Quantization

  17. AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ

    May 22, 2026Zhaoyang Meng, Zhengyao Ma, Kecan Mao +2Neural Audio CodecsNeural Encoding

  18. GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

    May 21, 2026Jianing Deng, Song Wang, Dongwei Wang +4Mixed-Precision QuantizationLLM Quantization

  19. FTerViT: Fully Ternary Vision Transformer

    May 20, 2026Szymon Ruciński, Pietro Bonazzi, Engin Türetken +3Ternary QuantizationVision Transformer

  20. Q-ARVD: Quantizing Autoregressive Video Diffusion Models

    May 20, 2026Siao Tang, Xinyin Ma, Gongfan Fang +2Video Diffusion ModelsDiffusion Model Quantization

  21. ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models

    May 19, 2026Arash Akbari, Arman Akbari, Masih Eskandar +11Mixed-Precision QuantizationVLM Quantization