Mixture-of-Experts Quantization

Latest papers 16

All topics
CardsList
  1. TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

    Oct 6, 2026Xin Wang, Hao Yu, Zhengyang Zhuge +9LLM QuantizationQuantization-Aware Training

  2. Quality-Constrained Routing over a Fixed Pool of Quantized Mixture-of-Experts Instances

    Sep 14, 2026Zhenghong Huang, Hongfan Wu, Jiheng ZhangMixture-of-Experts InferenceMixture-of-Experts Quantization

  3. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

    Aug 31, 2026Deokjae Lee, Sihun Chu, Hyun Oh SongMixed-Precision QuantizationLLM Quantization

  4. RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention

    Aug 8, 2026Anthony. Lui, Mohamed. Elsaied, N. P. SavaniExpert OffloadingMixture-of-Experts Language Models

  5. PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

    Jul 17, 2026Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1LLM QuantizationMixture-of-Experts Language Models

  6. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  7. AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

    Jun 3, 2026Wanqi Yang, Yuexiao Ma, Alexander Conzelmann +4Mixed-Precision QuantizationMixture-of-Experts Language Models

  8. BitsMoE: Cost-Aware Bit Allocation in Spectral Space for MoE LLM Quantization

    May 22, 2026Jiayu Zhao, Zihan Teng, Minhao Fan +4Mixed-Precision QuantizationLLM Quantization

  9. GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

    May 21, 2026Jianing Deng, Song Wang, Dongwei Wang +4Mixed-Precision QuantizationLLM Quantization

  10. RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression

    May 14, 2026Zhengjia Zhong, Shuyan Ke, Zaizhou Lin +3Residual VQVector Quantization

  11. TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling

    May 10, 2026Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu +1Efficient InferenceMixture-of-Experts Inference

  12. Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference

    Date pendingKexin Chu, Dawei Xiang, Zixu Shen +3Mixed-Precision QuantizationGPU Acceleration