Mixed-Precision Quantization

Latest papers 100

All topics
CardsList
  1. AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

    Jun 3, 2026Wanqi Yang, Yuexiao Ma, Alexander Conzelmann +4Mixed-Precision QuantizationMixture-of-Experts Language Models

  2. QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy

    Jun 3, 2026Pasindu Wickramasinghe, Achyuta Muthuvelan, Rachmad Vidya Wicaksana Putra +2Mixed-Precision QuantizationLLM Quantization

  3. LLM Compression with Jointly Optimizing Architectural and Quantization choices

    Jun 2, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  4. QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer

    May 29, 2026Zhizhen Pan, Hesong Wang, Huan WangMixed-Precision Quantization3D ViTs

  5. WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization

    May 26, 2026Phong Nam Huu Nguyen, Khoi M. Le, Cong-Duy T Nguyen +3Mixed-Precision QuantizationLLM Quantization

  6. Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training

    May 24, 2026Ayush K. Varshney, Konstantinos Vandikas, Šarūnas Girdzijauskas +2Mixed-Precision QuantizationQuantization-Aware Training

  7. MX-SAFE: Versatile Inference- and Training-Proof Microscaling Format with On-the-Fly Exponent and Mantissa Bit Allocation

    May 23, 2026Dahoon Park, Jahyun Koo, Sangwoo Hwang +1Mixed-Precision QuantizationAI Accelerator Inference

  8. BitsMoE: Cost-Aware Bit Allocation in Spectral Space for MoE LLM Quantization

    May 22, 2026Jiayu Zhao, Zihan Teng, Minhao Fan +4Mixed-Precision QuantizationLLM Quantization

  9. GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

    May 21, 2026Jianing Deng, Song Wang, Dongwei Wang +4Mixed-Precision QuantizationLLM Quantization

  10. ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models

    May 19, 2026Arash Akbari, Arman Akbari, Masih Eskandar +11Mixed-Precision QuantizationVLM Quantization

  11. GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

    May 18, 2026Zhangyang Yao, Haiyan Zhao, Haoyu Wang +3Mixed-Precision QuantizationLLM Quantization

  12. TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

    May 16, 2026Hanzhang Shen, Haoran Wu, Yiren Zhao +1Mixed-Precision QuantizationLLM Inference Acceleration

  13. When Bits Break Recourse: Counterfactual-Faithful Quantization

    May 16, 2026Chaymae Yahyati, Ismail Lamaakal, Khalid El Makkaoui +1Mixed-Precision QuantizationCounterfactual Evaluation

  14. QuIDE: Mastering the Quantized Intelligence Trade-off via Active Optimization

    May 5, 2026Xiantao JiangMixed-Precision QuantizationLLM Quantization

  15. Performance Optimization and Comparative Analysis of Generative AI Models on Advanced Accelerators

    May 5, 2026Amitash Nanda, Javier Hernandez Nicolau, Madhusudan Gujral +3Mixed-Precision QuantizationAI Accelerator Inference

  16. Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

    May 4, 2026Joydeep ChandraMixed-Precision QuantizationInformation Bottleneck

  17. EdgeLPR: On the Deep Neural Network trade-off between Precision and Performance in LiDAR Place Recognition

    May 4, 2026Pierpaolo Serio, Hetian Wang, Zixiang Wei +4Mixed-Precision QuantizationEfficient Neural Network Inference

  18. WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization

    May 4, 2026Wei Tao, Xiaoyang Qu, Peiqiang Wang +4Mixed-Precision QuantizationVLM Quantization

  19. GETA-3DGS: Automatic Joint Structured Pruning and Quantization for 3D Gaussian Splatting

    May 3, 2026Baobing Zhang, Wanxin Sui3DGS CompressionMixed-Precision Quantization

  20. CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

    Apr 29, 2026Zhe Ding, Su Pan, Duowei PanMixed-Precision QuantizationLLM Quantization

  21. QuantClaw: Precision Where It Matters for OpenClaw

    Apr 24, 2026Manyi Zhang, Ji-Fu Li, Zhongao Sun +5Mixed-Precision QuantizationLLM Quantization

  22. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2LLM Inference EfficiencyMixed-Precision Quantization

  23. On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks

    Apr 22, 2026Aarav Gupta, Gururaj Deshpande, Chandreyi ChakrabortyMixed-Precision QuantizationDiffusion Model Quantization

  24. LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

    Apr 20, 2026Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen +2Mixed-Precision QuantizationDiffusion Transformer

  25. Bitwise Systolic Array Architecture for Runtime-Reconfigurable Multi-precision Quantized Multiplication on Hardware Accelerators

    Feb 26, 2026Yuhao Liu, Salim Ullah, Akash KumarMixed-Precision QuantizationFPGA-Based Neural Network Acceleration

  26. Towards Training-free Automatic Proxy Discovery via Large Language Models for Mixed Precision Quantization

    Dec 8, 2025Haidong Kang, Jun Du, Guo YuMixed-Precision QuantizationLarge Language Model-Guided Optimization

  27. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization

  28. LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

    Sep 28, 2025Shubhang Bhatnagar, Andy Xu, Kar-Han Tan +1Mixed-Precision QuantizationLLM Quantization

  29. On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs

    Sep 22, 2025Rongguang Ye, Ming Tang, Edith C. H. NgaiMixed-Precision QuantizationLLM Quantization

  30. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Mixed-Precision QuantizationLLM Quantization

  31. Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference

    Date pendingKexin Chu, Dawei Xiang, Zixu Shen +3Mixed-Precision QuantizationGPU Acceleration