Mixed-Precision Quantization

Momentum

4 papers in the last four weeks, up 33% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 40

All topics
CardsList
  1. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Post-Training QuantizationMixed-Precision Quantization

  2. RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models

    Sep 23, 2026David Población-Criado, Dario Garcia-Gasulla, Eduardo QuinonesMixed-Precision QuantizationNeural Network Inference

  3. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLarge Language Model Quantization

  4. Task-Aware QUBO Allocation for Mixed-Precision Quantization

    Sep 4, 2026Osama Orabi, Artur Zagitov, Hadi Salloum +2Mixed-Precision QuantizationQuadratic Unconstrained Binary Optimization

  5. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationMixture-Of-Experts Large Language Models

  6. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Inference Optimization

  7. MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

    Aug 7, 2026Zijun Jiang, Yangdi LyuMixed-Precision QuantizationArtificial Intelligence Systems

  8. APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

    Aug 6, 2026Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou +2Mixed-Precision QuantizationStructured Pruning

  9. NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory

    Aug 3, 2026Yizhe Chen, Wenshuai Yao, Saiya Wang +6In-Memory ComputingMixed-Precision Quantization

  10. MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

    Jul 30, 2026Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixed-Precision QuantizationSelf-Supervised Vision Transformers

  11. MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models

    Jul 25, 2026Ashitabh Misra, Madhav Agrawal, Arham Jain +1Mixed-Precision QuantizationMix

  12. MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

    Jul 20, 2026Simla Burcu Harma, Danila Mishin, Zhengyuan Su +7Large Language Model QuantizationMixed-Precision Quantization

  13. Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

    Jul 14, 2026Joshua HillMixed-Precision QuantizationSaturation

  14. M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

    Jul 12, 2026Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup +1Mixed-Precision QuantizationAdam

  15. Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

    Jul 1, 2026Fei Wang, Chao Xue, Taoran Liu +3Large Language Model QuantizationMixed-Precision Quantization

  16. Minimizing Quantized Semantic Age of Information (QSAoI) in Foundation Model-Based Semantic Communications

    Jun 30, 2026Huanyu Zhang, Yulin Hu, Xiaopeng Yuan +2Semantic CommunicationsSource-Channel Coding

  17. SEADA: An efficient methodology for optimizing mixed-precision DNNs on multi-precision spatial architectures

    Jun 26, 2026Leandro Fiorin, Marco Ronzani, Cristina SilvanoMixed-Precision QuantizationEfficient Planning

  18. Efficient Network Inference via Hardware-Aware Architecture Search, Model Pruning & Quantization

    Jun 22, 2026Lucas Heublein, Mark Deutel, Axel Plinge +1Neural Network InferenceHardware-Aware

  19. Hybrid Compression: Integrating Pruning and Quantization for Optimized Neural Networks

    Jun 22, 2026Minh-Loi Nguyen, Long-Bao Nguyen, Van-Hieu Huynh +2Compressed ModelNeural Network Inference

  20. Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

    Jun 17, 2026Navin Ranjan, Andreas SavakisMixed-Precision QuantizationPost-Training Quantization

  21. Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression

    Jun 16, 2026Yifu Ding, Jiacheng Wang, Ge Yang +4Mixture-Of-Expert InferenceMixture-Of-Experts

  22. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Post-Training QuantizationMixed-Precision Quantization

  23. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

    Jun 7, 2026Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang +3Key-Value Cache CompressionKey-Value Cache

  24. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

    Jun 5, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLarge Language Model Compression

  25. AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

    Jun 3, 2026Wanqi Yang, Yuexiao Ma, Alexander Conzelmann +4Mixed-Precision Quantization

  26. Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

    May 26, 2026Fengfa Li, Hongjin Ji, Yifeng Ding +2Mixture-Of-Expert InferenceMixed-Precision Quantization

  27. Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training

    May 24, 2026Ayush K. Varshney, Konstantinos Vandikas, Šarūnas Girdzijauskas +2Mixed-Precision QuantizationQuantization-Aware Training

  28. MX-SAFE: Versatile Inference- and Training-Proof Microscaling Format with On-the-Fly Exponent and Mantissa Bit Allocation

    May 23, 2026Dahoon Park, Jahyun Koo, Sangwoo Hwang +1Mixed-Precision QuantizationNeural Network Inference

  29. GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

    May 21, 2026Jianing Deng, Song Wang, Dongwei Wang +4Mixed-Precision QuantizationMixture-Of-Experts Large Language Models

  30. GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

    May 18, 2026Zhangyang Yao, Haiyan Zhao, Haoyu Wang +3Mixed-Precision QuantizationToken Budget Allocation

  31. Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

    May 4, 2026Joydeep ChandraSpeakerMixed-Precision Quantization

  32. MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching

    Apr 29, 2026Shuzhao Xie, Junchen Ge, Weixiang Zhang +103D GaussianLarge-Scale 3D Editing Dataset

  33. FED-FSTQ: Fisher-Guided Token Quantization for Communication-Efficient Federated Fine-Tuning of LLMs on Edge Devices

    Apr 28, 2026Changyu Li, Shuanghong Huang, Jiashen Liu +5Large Language Model QuantizationFedavg

  34. Focus Session: Hardware and Software Techniques for Accelerating Multimodal Foundation Models

    Apr 23, 2026Muhammad Shafique, Abdul Basit, Muhammad Abdullah Hanif +3Multimodal Foundation ModelInference Workloads

  35. Bitwise Systolic Array Architecture for Runtime-Reconfigurable Multi-precision Quantized Multiplication on Hardware Accelerators

    Feb 26, 2026Yuhao Liu, Salim Ullah, Akash KumarMixed-Precision QuantizationField-Programmable Gate Arrays

  36. Towards Training-free Automatic Proxy Discovery via Large Language Models for Mixed Precision Quantization

    Dec 8, 2025Haidong Kang, Jun Du, Guo YuMixed-Precision QuantizationEvolutionary Search

  37. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Large Language Model QuantizationMixed-Precision Quantization

  38. Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference

    Date pendingKexin Chu, Dawei Xiang, Zixu Shen +3Mixture-Of-Expert InferenceMixed-Precision Quantization