Mixed-Precision Quantization

Latest papers 97

All topics
CardsList
  1. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

    Oct 5, 2026Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4Mixed-Precision QuantizationLLM Quantization

  2. Backward-State Policy Is Part of the Learning Algorithm

    Sep 30, 2026Shuxiao Xie, Shuyang Xie, Dezhi Ran +2Mixed-Precision QuantizationBackpropagation

  3. Fiona: Accelerating FHE Inference with Packing-Aware Ternary Weights

    Sep 28, 2026Yiteng Peng, Zhibo Liu, Dongwei Xiao +1Mixed-Precision QuantizationEfficient Neural Network Inference

  4. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Mixed-Precision QuantizationLLM Quantization

  5. Q-WAM: 4-Bit Quantization of World Action Models with Action-Subspace Protection

    Sep 27, 2026Arash Akbari, Arman Akbari, Jingwu Luo +7Mixed-Precision Quantization4-Bit Quantization

  6. RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models

    Sep 23, 2026David Población-Criado, Dario Garcia-Gasulla, Eduardo QuinonesMixed-Precision QuantizationEdge Inference

  7. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  8. VLAQuantBench: Closed-Loop Evaluation of Post-Training Quantization for Vision-Language-Action Models

    Sep 21, 2026Jiuyi Xu, Qing Jin, Meida Chen +3Mixed-Precision QuantizationEfficient VLA Model Inference

  9. The Undetected Damage of Quantization on Retrieval and How to Fix It

    Sep 21, 2026Luca Zhou, Alessandro Zirilli, Daniele Solombrino +2Mixed-Precision QuantizationInformation Retrieval

  10. Text Scores Do Not Establish Performance on Lexically Non-Diagnostic Speech Tasks: A Qwen2-Audio Quantization Case Study

    Sep 20, 2026Mengzhe Geng, Jinxi Ji, Junhao XuAudio-Language Model EvaluationMixed-Precision Quantization

  11. Task-Aware QUBO Allocation for Mixed-Precision Quantization

    Sep 4, 2026Osama Orabi, Artur Zagitov, Hadi Salloum +2Mixed-Precision QuantizationCost-Aware Inference

  12. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationLLM Quantization

  13. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  14. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization

  15. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  16. HAMP-LIC: Hessian-Aware Mixed-Precision Post-Training Quantization for Learned Image Compression

    Aug 12, 2026Yuefeng ZhangMixed-Precision QuantizationLearned Image Compression

  17. PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks

    Aug 7, 2026Hui Xie, Tong Shi, Haotong Qin +3Mixed-Precision Quantization4-Bit Quantization

  18. MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

    Aug 7, 2026Zijun Jiang, Yangdi LyuMixed-Precision QuantizationEfficient Neural Network Inference

  19. APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

    Aug 6, 2026Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou +2Model CompressionMixed-Precision Quantization

  20. TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

    Aug 4, 2026Seokho Han, Dongwei Wang, Jinhee Kim +4Mixed-Precision QuantizationDiffusion Model Quantization

  21. NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory

    Aug 3, 2026Yizhe Chen, Wenshuai Yao, Saiya Wang +6Mixed-Precision QuantizationCompute-in-Memory

  22. GQ-FSL: Green Quantized Federated Split Learning

    Jul 31, 2026Idan Roth, Lutz LampeMixed-Precision QuantizationEnergy-Efficient ML

  23. MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

    Jul 30, 2026Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixed-Precision QuantizationVision Transformer

  24. MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models

    Jul 25, 2026Ashitabh Misra, Madhav Agrawal, Arham Jain +1Mixed-Precision QuantizationLLM Quantization

  25. MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

    Jul 20, 2026Simla Burcu Harma, Danila Mishin, Zhengyuan Su +7Mixed-Precision QuantizationLLM Quantization

  26. Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

    Jul 14, 2026Joshua HillMixed-Precision QuantizationLLM Quantization

  27. Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

    Jul 9, 2026Abdullah Al Shafi, Sumaiya Rahim SumaMixed-Precision QuantizationClassifier-Free Guidance

  28. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Mixed-Precision QuantizationLLM Quantization

  29. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

    Jul 5, 2026Siyu Ding, Mingchuan Ma, Jiabo Tong +3Language Model PretrainingMixed-Precision Quantization

  30. Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

    Jul 1, 2026Fei Wang, Chao Xue, Taoran Liu +3Mixed-Precision QuantizationLLM Quantization

  31. RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

    Jul 1, 2026Yaofu Liu, Wanli Lan, Jinxi Li +2Mixed-Precision QuantizationRotary Positional Embeddings

  32. Minimizing Quantized Semantic Age of Information (QSAoI) in Foundation Model-Based Semantic Communications

    Jun 30, 2026Huanyu Zhang, Yulin Hu, Xiaopeng Yuan +2Mixed-Precision QuantizationSemantic Communication

  33. SEADA: An efficient methodology for optimizing mixed-precision DNNs on multi-precision spatial architectures

    Jun 26, 2026Leandro Fiorin, Marco Ronzani, Cristina SilvanoMixed-Precision QuantizationEfficient Neural Network Inference

  34. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  35. Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

    Jun 19, 2026Zhenting Zhu, Lucas Thai, Shan Yu +5Mixed-Precision QuantizationLLM Inference

  36. Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

    Jun 17, 2026Navin Ranjan, Andreas SavakisMixed-Precision QuantizationVLM Quantization

  37. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  38. Quantizing Time-Series Models As Dynamical Systems: Trajectory-Based Quantization Sensitivity Score

    Jun 11, 2026Mariya Pavlova, Harrison Bo Hua Zhu, Lidia Vitanova +2Mixed-Precision QuantizationPost-Training Quantization

  39. TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

    Jun 11, 2026Zhixiong Zhao, Zukang Xu, Zhixuan Chen +3Mixed-Precision QuantizationLLM Quantization

  40. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Mixed-Precision QuantizationLLM Quantization

  41. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Mixed-Precision QuantizationLLM Quantization

  42. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

    Jun 7, 2026Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang +3Mixed-Precision QuantizationKV Caching

  43. On Low-Bit Quantization Errors in Speaker Verification: Diagnostic and Mitigation

    Jun 6, 2026Hugo Leguillier, Driss Matrouf, Guillaume Lechien +1Mixed-Precision QuantizationAdaptive Inference

  44. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

    Jun 5, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  45. AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

    Jun 3, 2026Wanqi Yang, Yuexiao Ma, Alexander Conzelmann +4Mixed-Precision QuantizationMixture-of-Experts Language Models

  46. QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy

    Jun 3, 2026Pasindu Wickramasinghe, Achyuta Muthuvelan, Rachmad Vidya Wicaksana Putra +2Mixed-Precision QuantizationLLM Quantization