Mixed-Precision Quantization

Latest papers 100

All topics
CardsList
  1. NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory

    Aug 3, 2026Yizhe Chen, Wenshuai Yao, Saiya Wang +6Mixed-Precision QuantizationCompute-in-Memory

  2. GQ-FSL: Green Quantized Federated Split Learning

    Jul 31, 2026Idan Roth, Lutz LampeMixed-Precision QuantizationEnergy-Efficient ML

  3. MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

    Jul 30, 2026Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixed-Precision QuantizationVision Transformer

  4. MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models

    Jul 25, 2026Ashitabh Misra, Madhav Agrawal, Arham Jain +1Mixed-Precision QuantizationLLM Quantization

  5. MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

    Jul 20, 2026Simla Burcu Harma, Danila Mishin, Zhengyuan Su +7Mixed-Precision QuantizationLLM Quantization

  6. Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

    Jul 14, 2026Joshua HillMixed-Precision QuantizationLLM Quantization

  7. Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

    Jul 9, 2026Abdullah Al Shafi, Sumaiya Rahim SumaMixed-Precision QuantizationClassifier-Free Guidance

  8. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Mixed-Precision QuantizationLLM Quantization

  9. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

    Jul 5, 2026Siyu Ding, Mingchuan Ma, Jiabo Tong +3Language Model PretrainingMixed-Precision Quantization

  10. Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

    Jul 1, 2026Fei Wang, Chao Xue, Taoran Liu +3Mixed-Precision QuantizationLLM Quantization

  11. RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

    Jul 1, 2026Yaofu Liu, Wanli Lan, Jinxi Li +2Mixed-Precision QuantizationRotary Positional Embeddings

  12. Minimizing Quantized Semantic Age of Information (QSAoI) in Foundation Model-Based Semantic Communications

    Jun 30, 2026Huanyu Zhang, Yulin Hu, Xiaopeng Yuan +2Mixed-Precision QuantizationSemantic Communication

  13. SEADA: An efficient methodology for optimizing mixed-precision DNNs on multi-precision spatial architectures

    Jun 26, 2026Leandro Fiorin, Marco Ronzani, Cristina SilvanoMixed-Precision QuantizationEfficient Neural Network Inference

  14. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  15. Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

    Jun 19, 2026Zhenting Zhu, Lucas Thai, Shan Yu +5Mixed-Precision QuantizationLLM Inference

  16. Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

    Jun 17, 2026Navin Ranjan, Andreas SavakisMixed-Precision QuantizationVLM Quantization

  17. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  18. Quantizing Time-Series Models As Dynamical Systems: Trajectory-Based Quantization Sensitivity Score

    Jun 11, 2026Mariya Pavlova, Harrison Bo Hua Zhu, Lidia Vitanova +2Mixed-Precision QuantizationPost-Training Quantization

  19. TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

    Jun 11, 2026Zhixiong Zhao, Zukang Xu, Zhixuan Chen +3Mixed-Precision QuantizationLLM Quantization

  20. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Mixed-Precision QuantizationLLM Quantization

  21. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Mixed-Precision QuantizationLLM Quantization

  22. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

    Jun 7, 2026Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang +3Mixed-Precision QuantizationKV Caching

  23. On Low-Bit Quantization Errors in Speaker Verification: Diagnostic and Mitigation

    Jun 6, 2026Hugo Leguillier, Driss Matrouf, Guillaume Lechien +1Mixed-Precision QuantizationAdaptive Inference

  24. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

    Jun 5, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization