Mixed-Precision Quantization

Latest papers 100

All topics
CardsList
  1. Q-PACE: Dynamic Precision Allocation for Quantization-Aware Training

    Oct 6, 2026Alexandra Volkova, Matin Ansaripour, Erik Schultheis +2LLM QuantizationQuantization-Aware Training

  2. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

    Oct 5, 2026Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4Mixed-Precision QuantizationLLM Quantization

  3. Backward-State Policy Is Part of the Learning Algorithm

    Sep 30, 2026Shuxiao Xie, Shuyang Xie, Dezhi Ran +2Mixed-Precision QuantizationBackpropagation

  4. Fiona: Accelerating FHE Inference with Packing-Aware Ternary Weights

    Sep 28, 2026Yiteng Peng, Zhibo Liu, Dongwei Xiao +1Mixed-Precision QuantizationEfficient Neural Network Inference

  5. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Mixed-Precision QuantizationLLM Quantization

  6. Q-WAM: 4-Bit Quantization of World Action Models with Action-Subspace Protection

    Sep 27, 2026Arash Akbari, Arman Akbari, Jingwu Luo +7Mixed-Precision Quantization4-Bit Quantization

  7. RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models

    Sep 23, 2026David Población-Criado, Dario Garcia-Gasulla, Eduardo QuinonesMixed-Precision QuantizationEdge Inference

  8. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  9. VLAQuantBench: Closed-Loop Evaluation of Post-Training Quantization for Vision-Language-Action Models

    Sep 21, 2026Jiuyi Xu, Qing Jin, Meida Chen +3Mixed-Precision QuantizationEfficient VLA Model Inference

  10. The Undetected Damage of Quantization on Retrieval and How to Fix It

    Sep 21, 2026Luca Zhou, Alessandro Zirilli, Daniele Solombrino +2Mixed-Precision QuantizationInformation Retrieval

  11. Text Scores Do Not Establish Performance on Lexically Non-Diagnostic Speech Tasks: A Qwen2-Audio Quantization Case Study

    Sep 20, 2026Mengzhe Geng, Jinxi Ji, Junhao XuAudio-Language Model EvaluationMixed-Precision Quantization

  12. Task-Aware QUBO Allocation for Mixed-Precision Quantization

    Sep 4, 2026Osama Orabi, Artur Zagitov, Hadi Salloum +2Mixed-Precision QuantizationCost-Aware Inference

  13. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationLLM Quantization

  14. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Mixed-Precision QuantizationLLM Quantization

  15. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Mixed-Precision QuantizationLLM Quantization

  16. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  17. HAMP-LIC: Hessian-Aware Mixed-Precision Post-Training Quantization for Learned Image Compression

    Aug 12, 2026Yuefeng ZhangMixed-Precision QuantizationLearned Image Compression

  18. PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks

    Aug 7, 2026Hui Xie, Tong Shi, Haotong Qin +3Mixed-Precision Quantization4-Bit Quantization

  19. MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

    Aug 7, 2026Zijun Jiang, Yangdi LyuMixed-Precision QuantizationEfficient Neural Network Inference

  20. APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

    Aug 6, 2026Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou +2Model CompressionMixed-Precision Quantization

  21. TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

    Aug 4, 2026Seokho Han, Dongwei Wang, Jinhee Kim +4Mixed-Precision QuantizationDiffusion Model Quantization