Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. A Note on TurboQuant and the Earlier DRIVE/EDEN Line of Work

    Apr 20, 2026Ran Ben-Basat, Yaniv Ben-Itzhak, Gal Mendelson +3Residual VQVector Quantization

  2. LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

    Apr 20, 2026Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen +2Mixed-Precision QuantizationDiffusion Transformer

  3. DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization

    Apr 20, 2026Haokun Lin, Xinle Jia, Haobo Xu +7LLM Quantization4-Bit Quantization

  4. When Flat Minima Fail: Characterizing INT4 Quantization Collapse After FP32 Convergence

    Apr 16, 2026Marcus ArmstrongLLM Quantization4-Bit Quantization

  5. A Comparative Study of CNN Optimization Methods for Edge AI: Exploring the Role of Early Exits

    Apr 16, 2026Nekane Fernandez, Ivan Valdes, Steven Van Vaerenbergh +2Efficient InferenceEdge Inference

  6. Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate

    Apr 15, 2026Jaemin Kim, Sungkyun Kim, Junyeol Lee +1LLM QuantizationLanguage Model Calibration

  7. From Arithmetic to Logic: The Resilience of Logic and Lookup-Based Neural Networks Under Parameter Bit-Flips

    Mar 24, 2026Alan T. L. Bacellar, Sathvik Chemudupati, Shashank Nag +4Neural Network RobustnessNeural Network Quantization

  8. Q-Drift: Quantization-Aware Drift Correction for Diffusion Model Sampling

    Mar 18, 2026Sooyoung Ryu, Mathieu Salzmann, Saqib JavedDiffusion Model QuantizationDiffusion Model Sampling

  9. DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models

    Mar 9, 2026Zihao Zheng, Hangyu Cao, Chibang Tao +9VLM QuantizationEfficient VLA Model Inference

  10. Dissecting Quantization Error: A Concentration-Alignment Perspective

    Mar 4, 2026Marco Federici, Boris van Breugel, Paul Whatmough +1LLM Quantization4-Bit Quantization

  11. Bitwise Systolic Array Architecture for Runtime-Reconfigurable Multi-precision Quantized Multiplication on Hardware Accelerators

    Feb 26, 2026Yuhao Liu, Salim Ullah, Akash KumarMixed-Precision QuantizationFPGA-Based Neural Network Acceleration

  12. DynamiQ: Accelerating Gradient Synchronization using Compressed Multi-hop All-reduce

    Feb 9, 2026Wenchen Han, Shay Vargaftik, Michael Mitzenmacher +1Communication-Efficient Distributed TrainingHigh-Performance Computing

  13. Investigating Social Bias Changes in Quantized Language Models

    Feb 5, 2026Stanley Z. Hua, Sanae Lotfi, Irene Y. ChenLLM QuantizationSocial Bias in Language Models

  14. MatGPTQ: Efficient and Accurate Inference over Nested Quantized Models

    Feb 3, 2026Maximilian Kleinegger, Elvir Crnčević, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  15. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  16. ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

    Jan 12, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +3LLM Quantization4-Bit Quantization

  17. QuantKAN: A Unified Quantization Framework for Kolmogorov Arnold Networks

    Nov 24, 2025Kazi Ahmed Asif Fuad, Lizhong ChenQuantization-Aware TrainingKolmogorov-Arnold Networks

  18. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization

  19. Activation Quantization of Vision Encoders Needs Prefixing Registers

    Oct 6, 2025Seunghyeon Kim, Taesun Yeom, Jinho Kim +3Activation OutliersActivation Quantization

  20. QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

    Sep 3, 2025Seth Z. Zhao, Huizhi Zhang, Zhaowei Li +11V2X CommunicationCooperative Perception

  21. SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models

    Aug 5, 2025Yufei Xue, Yushi Huang, Lunjie Zhu +2Vision-Language ModelsVLM Quantization

  22. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Mixed-Precision QuantizationLLM Quantization

  23. GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers

    Jun 13, 2025Guang Liang, Xinyao Liu, Jianxin WuQuantization-Aware Training4-Bit Quantization

  24. Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference

    Date pendingKexin Chu, Dawei Xiang, Zixu Shen +3Mixed-Precision QuantizationGPU Acceleration

  25. Benford's Law as a Distributional Prior for Post-Training Quantization of Large Language Models

    Date pendingArthur Negrão, Pedro Silva, Vander L. S. Freitas +2LLM Quantization4-Bit Quantization

  26. LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization

    Date pendingHaoyu Wang, Xingyu Yu, Haiyan Zhao +2LLM QuantizationQuantization-Aware Training

  27. REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent

    Date pendingQian Zhang, Yaoming Li, Zhewen Tan +9LLM QuantizationPost-Training Quantization