Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

    Jun 25, 2026Shigeng Wang, Chao Li, Yangyuxuan Kang +2LLM QuantizationTernary Quantization

  2. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

    Jun 25, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +44-Bit QuantizationLLM Inference Acceleration

  3. What Survives When You Compress a Recursive Reasoner for the Edge?

    Jun 25, 2026Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye +2Model CompressionEfficient Neural Network Inference

  4. Hierarchical Reinforcement Learning for Neural Network Compression (HiReLC): Pruning and Quantization

    Jun 24, 2026Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj +2Hierarchical RLNeural Network Quantization

  5. Neural Network Quantization by Learning Low-Loss Subspaces

    Jun 23, 2026Vladimir Protsenko, Mikhalina Kharkevich, Alexander Vashchilko +1Neural Network OptimizationNeural Network Quantization

  6. RoPE-Aware Bit Allocation for KV-Cache Quantization

    Jun 23, 2026Fengfeng Liang, Yuechen Zhang, Jiaya JiaKV CachingLLM Inference Acceleration

  7. ScalePredictor: Instance-aware Scale Learning for Accurate Quantization of Vision Transformers

    Jun 20, 2026Changjun Li, Runqing Jiang, Lian Xu +3Vision TransformerActivation Quantization

  8. Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

    Jun 17, 2026Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez +1LLM QuantizationLLM Evaluation

  9. Ternary Mamba: Grouped Quantization-Aware Training of W1.58A16 State Space Models

    Jun 16, 2026Ramprasath Ganesaraja, Sahil Dilip Panse, Swathika NLLM QuantizationTernary Quantization

  10. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  11. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  12. AQ4SViT: An Automated Quantization Framework with Search Gating Policy for Compressing Spiking Vision Transformers

    Jun 14, 2026Rachmad Vidya Wicaksana Putra, Saad Iftikhar, Muhammad ShafiqueSpiking TransformersNeural Network Quantization

  13. Signed Symmetric Quantization for Few-Bit Integers

    Jun 12, 2026Ian Colbert, Eashan Dash, Pablo Monteagudo-Lago +5LLM QuantizationWeight-Only Quantization

  14. Quantizing Time-Series Models As Dynamical Systems: Trajectory-Based Quantization Sensitivity Score

    Jun 11, 2026Mariya Pavlova, Harrison Bo Hua Zhu, Lidia Vitanova +2Mixed-Precision QuantizationPost-Training Quantization

  15. TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

    Jun 11, 2026Zhixiong Zhao, Zukang Xu, Zhixuan Chen +3Mixed-Precision QuantizationLLM Quantization

  16. Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

    Jun 11, 2026Liza Babaoglu, Shuangyi Chen, Ashish KhistiLLM QuantizationWeight-Only Quantization

  17. Reducing the Complexity of Deep Learning Models for EEG Analysis on Wearable Devices

    Jun 10, 2026Farough Shayeste Roodi, Parham Zilouchian Moghaddam, Mahdi Mohammadi-nasab +3ElectroencephalographyEEG Seizure Detection

  18. UniSVQ: 2-bit Unified Scalar-Vector Quantization

    Jun 9, 2026Haoyu Wang, Haiyan Zhao, Xingyu Yu +4LLM QuantizationVector Quantization

  19. Understanding Quantization-Aware Training: Gradients at Quantized Weights Bias to the Low-Loss Basin

    Jun 8, 2026Hanyang Li, Jianhao Ma, Ying CuiQuantization-Aware TrainingNeural Network Optimization

  20. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

    Jun 7, 2026Hong Guo, Nianhui Guo, Weixing Wang +3LLM QuantizationGPU Kernel Optimization

  21. SPEAR: A System for Post-Quantization Error-Adaptive Recovery Enabling Efficient Low-Bit LLM Serving

    Jun 4, 2026Hongyuan Liu, Yawei Li, Zhiqiang Que +3LLM QuantizationLLM Serving

  22. AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

    Jun 3, 2026Wanqi Yang, Yuexiao Ma, Alexander Conzelmann +4Mixed-Precision QuantizationMixture-of-Experts Language Models

  23. Toward Multi-Domain and Long-Tailed Quantization via Feature Alignment and Scaling

    Jun 3, 2026Ting-An Chen, Chin-Yuan Yeh, De-Nian YangLong-Tail LearningLow-Bit Quantization

  24. QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy

    Jun 3, 2026Pasindu Wickramasinghe, Achyuta Muthuvelan, Rachmad Vidya Wicaksana Putra +2Mixed-Precision QuantizationLLM Quantization

  25. Characterizing the Impact of NVFP4 Quantization for Low-Power Edge AI Deployment

    Jun 3, 2026Ovishake Sen, Venkata Nithin Kamineni, Daniel Lobo +3Efficient Neural Network InferenceEdge Inference