Mixed-Precision Quantization

Latest papers 100

All topics
CardsList
  1. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2LLM Inference EfficiencyMixed-Precision Quantization

  2. On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks

    Apr 22, 2026Aarav Gupta, Gururaj Deshpande, Chandreyi ChakrabortyMixed-Precision QuantizationDiffusion Model Quantization

  3. LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

    Apr 20, 2026Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen +2Mixed-Precision QuantizationDiffusion Transformer

  4. Bitwise Systolic Array Architecture for Runtime-Reconfigurable Multi-precision Quantized Multiplication on Hardware Accelerators

    Feb 26, 2026Yuhao Liu, Salim Ullah, Akash KumarMixed-Precision QuantizationFPGA-Based Neural Network Acceleration

  5. Towards Training-free Automatic Proxy Discovery via Large Language Models for Mixed Precision Quantization

    Dec 8, 2025Haidong Kang, Jun Du, Guo YuMixed-Precision QuantizationLarge Language Model-Guided Optimization

  6. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization

  7. LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

    Sep 28, 2025Shubhang Bhatnagar, Andy Xu, Kar-Han Tan +1Mixed-Precision QuantizationLLM Quantization

  8. On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs

    Sep 22, 2025Rongguang Ye, Ming Tang, Edith C. H. NgaiMixed-Precision QuantizationLLM Quantization

  9. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Mixed-Precision QuantizationLLM Quantization

  10. Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference

    Date pendingKexin Chu, Dawei Xiang, Zixu Shen +3Mixed-Precision QuantizationGPU Acceleration