Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. Block-Sphere Vector Quantization

    May 19, 2026Heesang Ann, Joongkyu Lee, Min-hwan OhRotation-Based QuantizationVector Quantization

  2. OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

    May 19, 2026Zunhai Su, Rui Yang, Chao Zhang +11KV CachingRotation-Based Quantization

  3. MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization

    May 18, 2026Le Su, Xing Luo, Zhi JinLLM QuantizationPost-Training Quantization

  4. Attention Sinks and Outliers in Attention Residuals

    May 18, 2026Haozheng Luo, Haoran Dai, Shaoyang Zhang +10LLM QuantizationAttention Residual Connections

  5. OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

    May 18, 2026Zhongzhu Zhou, Donglin Zhuang, Jisen Li +4Rotation-Based QuantizationLLM Inference Acceleration

  6. CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model

    May 16, 2026Houji Wen, Jiangyong Yu, Jun Li +1Cross-Attention4-Bit Quantization

  7. E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight Anchoring

    May 16, 2026Wenjun Wang, Yanggan Gu, Shuo Cai +44-Bit QuantizationPost-Training Quantization

  8. DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

    May 16, 2026Sayeh Sharify, Mahsa Salmani, Hesham MostafaDiffusion TransformerDiffusion Model Quantization

  9. Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

    May 15, 2026Yipu Zhang, Jintao Cheng, Weilun Feng +5Feed-Forward 3D ReconstructionPost-Training Quantization

  10. Nonlinear Bipolar Compensation: Handling Outliers in Post-Training Quantization

    May 14, 2026Peilin Sun, Jianxin WuActivation OutliersPost-Training Quantization

  11. High-Rate Quantized Matrix Multiplication II

    May 13, 2026Or Ordentlich, Yury PolyanskiyLLM QuantizationRate-Distortion Theory

  12. Search Your Block Floating Point Scales!

    May 12, 2026Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu +104-Bit QuantizationLLM Inference Acceleration

  13. SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

    May 12, 2026Chengzhu Bao, Xianglong Yan, Zhiteng Li +3LLM Quantization4-Bit Quantization

  14. MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization

    May 12, 2026Yupeng Su, Ruijie Zhang, Ziyue Liu +24-Bit QuantizationMuon Optimizer

  15. ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

    May 11, 2026Ryan Lucas, Mehdi Makni, Xiang Meng +2LLM QuantizationAlternating Direction Method of Multipliers

  16. Nano-U: Efficient Terrain Segmentation for Tiny Robot Navigation

    May 11, 2026Federico Pizzolato, Francesco Pasti, Nicola BellottoRobot NavigationSemantic Segmentation

  17. PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models

    May 10, 2026Yongsen Cheng, Kai Liu, Kaiwen Tao +5Diffusion Model QuantizationPost-Training Quantization

  18. TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling

    May 10, 2026Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu +1Efficient InferenceMixture-of-Experts Inference

  19. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization