Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. JustQuant: You Don't Need Smoothing, SVD, or Rotation for 4-Bit Activation Quantization

    Sep 27, 2026Kaicheng Yang, Kaisen Yang, Chunyu Liu +8Diffusion Model QuantizationQuantization-Aware Training

  2. Chameleon: Dynamic Format Adapter for Efficient Diffusion

    Sep 27, 2026Arnab Sanyal, Sandeep ChinchaliDiffusion Model QuantizationPost-Training Quantization

  3. PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

    Sep 27, 2026Yutong Wang, Xingtong Ge, Enhuai Liu +4Video Diffusion ModelsDiffusion Transformer

  4. Beyond Model Size: Redesigning LiSenNet for embedded speech enhancement

    Sep 24, 2026Clément Laroche, Rasmus Kongsgaard OlssonEfficient Neural Network InferenceSpeech Enhancement

  5. RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models

    Sep 23, 2026David Población-Criado, Dario Garcia-Gasulla, Eduardo QuinonesMixed-Precision QuantizationEdge Inference

  6. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2LLM QuantizationLLM Inference

  7. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  8. On the Efficiency-Safety Dilemma in Large Reasoning Models

    Sep 20, 2026Yifei Yang, Zouying Cao, Xingrui Wang +4LLM Inference AccelerationLLM Jailbreak Attacks

  9. Predict Before You Deploy: Offline Prediction of Quantization-Induced Task Degradation for World Action Models

    Sep 16, 2026Jiuyi Xu, Jinjia Guo, Meida Chen +2World Action ModelsPost-Training Quantization

  10. Channel-Wise and Token-Aware Post-Training Quantization for Visual State Space Duality

    Sep 15, 2026Jonghyeon Lim, Changhoon YimVisual SSMsActivation Quantization

  11. Efficient AI Model Deployment Using Quantization Analysis Tool

    Sep 14, 2026Dwith Chenna, Kanishka MacherlaEfficient Neural Network InferenceNeural Network Quantization

  12. Attention Quantization for Tabular Foundation Models

    Sep 14, 2026Jonas M. Kübler, Benjamin Jäger, Klemens Flöge +2Efficient Transformer InferenceTabular Foundation Models

  13. Why Does Post-Training Quantization Work?

    Sep 10, 2026Yuxiang Chen, Michael Beyer, Jun Zhu +1LLM QuantizationPost-Training Quantization

  14. When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference

    Sep 7, 2026Ismail Erbas, Xavier Intes, Vikas PandeyRecurrent Neural NetworksPost-Training Quantization

  15. A Unified Rate-Distortion Perspective on Vector, Product, and Scalar Quantization

    Sep 2, 2026Xianghong Fang, Wenlong Mou, Yuan Yuan +2Vector QuantizationProduct Quantization

  16. A Closed-Loop Evaluation of Capability Loss and Recovery in Compressed Driving Policies

    Sep 1, 2026Ahmad Alfan Alfian Irfan, Nur Ahmad Khatim, Mansur AriefAutonomous Driving Safety EvaluationKnowledge Distillation

  17. HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

    Aug 31, 2026Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6LLM QuantizationLLM Inference Acceleration

  18. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationLLM Quantization

  19. TopGQ: Fast GNN Post-Training Quantization Leveraging Topology Information

    Aug 31, 2026Dain Kwon, Kanghyun Choi, Hyeyoon Lee +4Graph Neural NetworksActivation Quantization

  20. A Target-Centric Survey of Quantization-Aware Training

    Aug 30, 2026Jiamin Song, Mengjie Zhao, Zijing Wang +6LLM QuantizationQuantization-Aware Training

  21. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  22. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization