Mixture-of-Experts Language Models

Latest papers 147

All topics
CardsList
  1. XPERT: Expert Knowledge Transfer for Effective Training of Language Models

    May 9, 2026Chang Liu, Boyu Shi, Xu Yang +1Mixture-of-Experts Language ModelsKnowledge Augmentation for Language Models

  2. SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

    May 9, 2026Shengkun Tang, Zekun Wang, Bo Zheng +7Mixture-of-Experts PruningLLM Pruning

  3. ZAYA1-VL-8B Technical Report

    May 8, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsMixture-of-Experts Language Models

  4. SDG-MoE: Signed Debate Graph Mixture-of-Experts

    May 8, 2026Stepan Kulibaba, Kirill Labzin, Artem Dzhalilov +4Mixture-of-Experts Language ModelsMixture of Experts

  5. Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs

    May 8, 2026Andrea Sassella, Andrea Chizzola, Tommaso Bianchi +2LLM EvaluationMixture-of-Experts Language Models

  6. When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models

    May 8, 2026Youngsik Yoon, Siwei Wang, Wei Chen +1Mixture-of-Experts Language ModelsLLM Routing

  7. UniPool: Learning Expert-to-Layer Ownership from Brief Global Access

    May 7, 2026Minbin Huang, Han Shi, Chuanyang Zheng +5Mixture-of-Experts Language ModelsMixture of Experts

  8. EMO: Pretraining Mixture of Experts for Emergent Modularity

    May 7, 2026Ryan Wang, Akshita Bhagia, Sewon MinLanguage Model PretrainingMixture-of-Experts Language Models

  9. ZAYA1-8B Technical Report

    May 6, 2026Robert Washbourne, Rishi Iyer, Tomas Figliolia +15Mixture-of-Experts Language ModelsRL for Language Model Reasoning

  10. RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

    May 1, 2026Zhiyuan Xu, Joseph Gardiner, Sana Belguith +1Mixture-of-Experts Language ModelsAdversarial Attacks on LLMs

  11. SpaceMoE: Realizing Distributed Mixture-of-Experts Inference over Space Networks

    May 1, 2026Zhanwei Wang, Huiling Yang, Min Sheng +2Mixture-of-Experts Language ModelsMixture-of-Experts Inference

  12. Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation

    Apr 29, 2026Shouren Wang, Wang Yang, Chuang Ma +7Mixture-of-Experts Language ModelsLLM Reasoning

  13. FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving

    Apr 29, 2026Minghe Wang, Trever Schirmer, Mohammadreza Malekabbasi +1Mixture-of-Experts Language ModelsLLM Serving

  14. Mixture of Heterogeneous Grouped Experts for Language Modeling

    Apr 25, 2026Zhicheng Ma, Xiang Liu, Zhaoxiang Liu +5Expert Load BalancingMixture-of-Experts Language Models

  15. Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

    Apr 20, 2026Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia +3Continual Learning for LLMsMixture-of-Experts Language Models

  16. MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

    Apr 19, 2026Szu-Chi Chen, I-Ning Tsai, Yi-Cheng Lin +2Speech TranslationMixture-of-Experts Language Models

  17. Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation

    Apr 4, 2026Kening Zheng, Wei-Chieh Huang, Jiahao Huo +9Mixture-of-Experts Language ModelsMixture of Experts

  18. Limited Stereotype Control Through Routing Reweighting in MoE Language Models

    Mar 28, 2026Junhyeok Lee, Han Jang, Kyu Sung ChoiSocial Bias in Language ModelsDemographic Bias in Language Models

  19. Federated Mixture-of-Experts Alignment on Mobile Edge Networks under Data Heterogeneity

    Mar 22, 2026Zihan Fang, Qianru Wang, Haonan An +4Mixture-of-Experts Language ModelsFederated Learning Aggregation

  20. Routing-Aware Safety Alignment for Mixture-of-Experts Models

    Feb 4, 2026Jiacheng Liang, Yuhui Wang, Tanqiu Jiang +1Mixture-of-Experts Language ModelsLLM Alignment

  21. DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

    Jan 8, 2026Guanzhi Deng, Bo Li, Ronghao Chen +5Mixture-of-Experts Language ModelsFine-Tuning

  22. Mixtures of SubExperts for Large Language Continual Learning

    Nov 9, 2025Haeyong Kang, Hee Suk Yoon, Dahua Feng +1Continual Learning for LLMsMixture-of-Experts Language Models

  23. Ensemble Learning for Large Language Models in Text and Code Generation: A Survey

    Mar 13, 2025Mari Ashiga, Wei Jie, Fan Wu +5Mixture-of-Experts Language ModelsLanguage Model Ensembles