Mixture-of-Experts Models

Latest papers 297

All topics
CardsList
  1. CTS-MoE: Implicit Terrain Adaptation via Mixture-of-Experts for Perceptive Locomotion

    Jun 17, 2026Francisco Affonso, Matheus P. Angarola, Ana Luiza Mineiro +3Robot Policy AdaptationTerrain-Aware Robot Locomotion

  2. FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs

    Jun 17, 2026Lorenzo Sani, Zeyu Cao, Meghdad Kurmanji +5Expert ParallelismCommunication-Efficient Distributed Training

  3. SkillMoV: Mixture-of-View Routing with Prototype-Conditioned Gating for Unified Multi-View Proficiency Estimation

    Jun 16, 2026Edoardo Bianchi, Antonio LiottaMulti-View LearningMixture-of-Experts Models

  4. Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression

    Jun 16, 2026Yifu Ding, Jiacheng Wang, Ge Yang +4Mixture-of-Experts PruningLLM Pruning

  5. DynFS-MoE: Dynamic Functional-Structural Mixture-of-Experts for Post-Traumatic Epilepsy Diagnosis

    Jun 15, 2026Jun-En Ding, Spencer Chen, Henry Noren +6Medical DiagnosisNeuroimaging

  6. Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning

    Jun 14, 2026Donghyun Han, Yuseok Bae, Jung Uk Kim +1Vision Foundation Model AdaptationMulti-Task Learning

  7. How to Score Experts for One-Shot MoE Expert Pruning: A Unified Formulation and Selection Principle

    Jun 14, 2026Zongfang Liu, Jinghui Zhang, Zijian Ma +2Mixture-of-Experts PruningLLM Pruning

  8. Conflict-Aware Federated Fine-Tuning of Large Language Models with Mixture-of-Experts

    Jun 14, 2026Yijun Lu, Zihan Fang, Pengpeng Qiao +6Federated Learning AggregationLLM Fine-Tuning

  9. MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

    Jun 14, 2026Maoliang Li, Haojing Chen, Jiayu Chen +4Diffusion TransformerDiffusion Model Caching

  10. Towards a Unified Generative Model for Scarce Time Series with Domain Experts

    Jun 13, 2026Zihao Yao, Qi Zheng, Jiankai Zuo +1Diffusion TransformerTime Series Generation

  11. Director: Accelerating Distributed MoE Serving via Online Proactive Expert Placement

    Jun 13, 2026Qianli Liu, Kaibin Guo, Zicong Hong +5Expert ParallelismLLM Serving

  12. From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing

    Jun 12, 2026Hugo Daumain, Driss Matrouf, Khaled Khelif +1Audio Deepfake DetectionDomain Generalization

  13. Expert-Driven Survival Machines: Improving Stratification and Interpretability in Multiple Clinical Cohorts

    Jun 12, 2026Farica Zhuang, Zixuan Wen, Christos Davatzikos +1Adaptive Model RoutingSurvival Analysis

  14. A theoretical model for task routing in mixture-of-expert transformers

    Jun 12, 2026Vinoth Nandakumar, Yongli Xiang, Yunzhi Yao +2Transformer ExpressivityMixture of Experts

  15. CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts

    Jun 11, 2026Bo Liu, Di Dai, Jingwei Liu +5Time-Series Causal DiscoveryMixture-of-Experts Models

  16. Redesign Mixture-of-Experts Routers with Manifold Power Iteration

    Jun 10, 2026Songhao Wu, Ang Lv, Ruobing Xie +1Mixture-of-Experts Language ModelsExpert Routing

  17. Multi-Rate Mixture of Experts for Accelerating Liquid Neural Network Training

    Jun 10, 2026Shilong Zong, Almuatazbellah Boker, Hoda EldardiryIrregular Time-Series ModelingLiquid Neural Networks

  18. MSUE: Multi-Modal Soccer Understanding Expert

    Jun 10, 2026Litao Li, Yibo Yu, Yufeng Hu +4Visual Question AnsweringVideo QA

  19. From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

    Jun 9, 2026Leonard Engmann, Christian Medeiros Adriano, Holger GieseMixture-of-Experts PruningLLM Auditing

  20. MosaicIMU: Composing Carrier Experts for Generalizable Neural Inertial Odometry

    Jun 8, 2026Junye Zou, Huiyi Yan, Xinning Xu +4Inertial OdometryDomain Adaptation

  21. STAR: Rethinking MoE Routing as Structure-Aware Subspace Learning

    Jun 7, 2026Sumin Park, Noseong ParkSparse Mixture-of-ExpertsExpert Routing

  22. LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts

    Jun 6, 2026Maxx Richard Rahman, Prakhar Kumar, Wolfgang MaassMissing-Modality LearningMultimodal Robustness

  23. Less is MoE: Trimming Experts in Domain-Specialist Language Models

    Jun 4, 2026Haoze He, Xinkai Zou, Xuan Jiang +4Mixture-of-Experts PruningLLM Pruning

  24. TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

    Jun 3, 2026Jiangyang He, Shaolin Zhu, Deyi XiongMixture-of-Experts PruningLLM Pruning

  25. Treat Traffic Like Trees: A Semantic-Preserving Hierarchical Graph-Based Expert Framework for Encrypted Traffic Analysis

    Jun 3, 2026Yuantu Luo, Jun Tao, Linxiao Yu +1Graph Neural NetworksEncrypted Network Traffic Analysis

  26. UltraEP: Unleash MoE Training and Inference on Rack-Scale Nodes with Near-Optimal Load Balancing

    Jun 2, 2026Xinming Wei, Chao Jin, Tuo Dai +10Expert ParallelismExpert Load Balancing

  27. Expert-Aware Causal Tracing of Factual Recall in Sparse MoE Language Models

    Jun 2, 2026Yuetian Lu, Ali Modarressi, Yihong Liu +1Mixture-of-Experts Language ModelsSparse Mixture-of-Experts