Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  2. SoftWater: Class-Aware Rate Allocation for Softmax Quantization

    Aug 12, 2026Joao V. Cavalcanti, Ashia C. WilsonLLM QuantizationPost-Training Quantization

  3. From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization

    Aug 10, 2026Achille Jacquemond, Yuma Ichikawa, Akira SakaiLLM QuantizationPost-Training Quantization

  4. LegoLM: Structured Weight Sharing for Large Language Models

    Aug 9, 2026Joseph BinghamLLM QuantizationLLM Compression

  5. Quantization Degradation in Large Language Models: A Signal-Noise Perspective

    Aug 8, 2026Chenxi Zhou, Pengfei Cao, Jinyu Ye +5LLM QuantizationWeight-Only Quantization

  6. ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

    Aug 7, 2026Yongge Ma, Guoan Wang, Feiyu Wang +5LLM QuantizationPost-Training Quantization

  7. MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

    Aug 7, 2026Zijun Jiang, Yangdi LyuMixed-Precision QuantizationEfficient Neural Network Inference

  8. Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

    Aug 6, 2026Zekun Wu, Swati Dhiman, Adriano KoshiyamaPost-Training QuantizationLow-Bit Quantization

  9. BaKron: Efficient Quantization with Kronecker-Factored Hessians

    Aug 6, 2026Johann Birnick, Rayan SaabPost-Training QuantizationNeural Network Quantization

  10. One Qubit Can Beat One Bit: Quantum Advantage for Post-Training Quantization

    Aug 5, 2026Yuma Ichikawa, Moeto MishimaPost-Training QuantizationNeural Network Quantization

  11. TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

    Aug 4, 2026Seokho Han, Dongwei Wang, Jinhee Kim +4Mixed-Precision QuantizationDiffusion Model Quantization

  12. NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory

    Aug 3, 2026Yizhe Chen, Wenshuai Yao, Saiya Wang +6Mixed-Precision QuantizationCompute-in-Memory

  13. Output-Aware Rotation for INT2 KV-Cache Quantization

    Aug 3, 2026Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong +4LLM InferenceKV Caching

  14. FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

    Aug 3, 2026Xianglong Yan, Hong Liu, Chengzhu Bao +4LLM Quantization4-Bit Quantization

  15. SparseKAN: Compressing Kolmogorov--Arnold Networks Across Basis Functions, Neurons, and Bits

    Aug 1, 2026Kazi Ahmed Asif Fuad, Lizhong ChenKolmogorov-Arnold NetworksNeural Network Quantization

  16. MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

    Jul 30, 2026Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixed-Precision QuantizationVision Transformer

  17. QuantWAMs: Calibrating at the Right Granularity for World Action Models

    Jul 30, 2026Jiacheng Zhou, Jinfan Lv, Ruixuan Li +4World Action ModelsPost-Training Quantization

  18. GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Byeongcheol Kim +2AI Accelerator InferenceRotation-Based Quantization

  19. Enabling Fully Integer-Only Inference for Lightweight Detection Transformers

    Jul 27, 2026Thanh Cong Le, Michal Szczepanski, Martyna PorebaEfficient Transformer InferenceEfficient Inference

  20. When Can Depth Replace Precision? A Resource Theory of Quantized Neural Computation

    Jul 25, 2026Mojtaba SoltanalianLow-Bit QuantizationNeural Network Quantization

  21. MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models

    Jul 25, 2026Ashitabh Misra, Madhav Agrawal, Arham Jain +1Mixed-Precision QuantizationLLM Quantization

  22. KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

    Jul 23, 2026Yann Bouquet, Alireza Khodamoradi, Kristof Denolf +1Diffusion TransformerDiffusion Model Quantization

  23. C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

    Jul 23, 2026Jiameng Li, Han Zhou, Matthew B. BlaschkoVLM QuantizationPost-Training Quantization

  24. Local Stability and Gaussian Smoothing of Quantized Neural Networks

    Jul 22, 2026Sergey Salishev, Anton Makarov, Oleg GranichinNeural Network Activation FunctionsNeural Network Approximation Theory