Mixture-of-Experts Language Models

Latest papers 147

All topics
CardsList
  1. CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

    Jun 30, 2026Dohyeon Kwon, Youngjin ParkMixture-of-Experts Language ModelsLLM Compression

  2. Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

    Jun 30, 2026Seyed Alireza Molavi, Zhan Su, Yan Hu +3Mixture-of-Experts Language ModelsLow-Rank Adaptation

  3. FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models

    Jun 26, 2026Fan Mo, Yuxuan Han, Geng Zhang +2Mixture-of-Experts PruningLLM Pruning

  4. Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

    Jun 22, 2026Kang Chen, Minshen Yu, Junjie Nian +3Mixture-of-Experts Language ModelsLLM Routing

  5. SoftMoE: Soft Differentiable Routing for Mixture-of-Experts in LLMs

    Jun 16, 2026Mikołaj Zasada, Łukasz Struski, Jacek Tabor +1Mixture-of-Experts Language ModelsSparse Mixture-of-Experts

  6. How to Score Experts for One-Shot MoE Expert Pruning: A Unified Formulation and Selection Principle

    Jun 14, 2026Zongfang Liu, Jinghui Zhang, Zijian Ma +2Mixture-of-Experts PruningLLM Pruning

  7. Decoupled Mixture-of-Experts for Parametric Knowledge Injection

    Jun 12, 2026Baoqing Yue, Weihang Su, Qingyao Ai +5Mixture-of-Experts Language ModelsKnowledge Augmentation for Language Models

  8. Redesign Mixture-of-Experts Routers with Manifold Power Iteration

    Jun 10, 2026Songhao Wu, Ang Lv, Ruobing Xie +1Mixture-of-Experts Language ModelsExpert Routing

  9. LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

    Jun 10, 2026Yan Hong, Kedong Xiu, Wei Li +6Mixture-of-Experts Language ModelsLLM Refusal Behavior

  10. PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

    Jun 9, 2026Xinyue Peng, Yi Qian, Jiaojiao Lin +2Mixture-of-Experts Language ModelsExpert Routing

  11. Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models

    Jun 9, 2026Jingyi Xie, Yijun Lin, Yinjiang Xiong +2Mixture-of-Experts Language ModelsMachine Unlearning

  12. Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning

    Jun 5, 2026Fatema Siddika, Md Anwar Hossen, Tanwi Mallick +1Continual Learning for LLMsMixture-of-Experts Language Models

  13. Sparsely gated tiny linear experts

    Jun 5, 2026Simon SchugTransformer FFNsMixture-of-Experts Language Models

  14. AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization

    Jun 3, 2026Wanqi Yang, Yuexiao Ma, Alexander Conzelmann +4Mixed-Precision QuantizationMixture-of-Experts Language Models

  15. TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

    Jun 3, 2026Jiangyang He, Shaolin Zhu, Deyi XiongMixture-of-Experts PruningLLM Pruning

  16. LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling

    Jun 3, 2026Wenkai Chen, Tianshu Li, Wenyong Huang +3Mixture-of-Experts Language ModelsLanguage Modeling

  17. Expert-Aware Refusal Steering

    Jun 2, 2026Anna C. Marbut, Daniel R. Olson, Travis J. WheelerMixture-of-Experts Language ModelsLanguage Model Steering

  18. Expert-Aware Causal Tracing of Factual Recall in Sparse MoE Language Models

    Jun 2, 2026Yuetian Lu, Ali Modarressi, Yihong Liu +1Mixture-of-Experts Language ModelsSparse Mixture-of-Experts

  19. When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models

    Jun 1, 2026Sarmistha Das, Vaibhav Vishal, Shreyas Guha +3Mixture-of-Experts Language ModelsLow-Resource Language Processing

  20. DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts

    May 31, 2026Jiarui Feng, Hanqing Zeng, Karish Grover +11Mixture-of-Experts Language ModelsSparse Mixture-of-Experts

  21. Confidence-Adaptive SwiGLU for Mixture-of-Experts

    May 30, 2026Shaohua Li, Xiuchao Sui, Xiaobing Sun +4Mixture-of-Experts Language ModelsMixture-of-Experts Models

  22. MESA: Improving MoE Safety Alignment via Decentralized Expertise

    May 30, 2026Yitong Sun, Yao Huang, Teng Li +5Mixture-of-Experts Language ModelsLLM Safety Alignment

  23. PithTrain: A Compact and Agent-Native MoE Training System

    May 29, 2026Ruihang Lai, Hao Kang, Haozhan Tang +6Mixture-of-Experts Language ModelsEfficient Language Model Training

  24. Mellum2 Technical Report

    May 29, 2026Marko Kojic, Ivan Bondyrev, Aral de Moor +6Mixture-of-Experts Language ModelsOpen-Weight Language Models