LLM Routing

LLM: Large Language Model

Momentum

30 papers in the last four weeks, up 88% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 224

All topics
CardsList
  1. RA-MoE: Routing-Aligned Fine-Tuning for Multilingual Adaptation of Mixture-of-Experts Models

    May 27, 2026Guanzhi Deng, Kuan Wu, Haibo Wang +6Mixture-of-Experts Language ModelsLLM Fine-Tuning

  2. ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference

    May 26, 2026Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang +3LLM Inference EfficiencyExpert Offloading

  3. SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning

    May 25, 2026Zhongling Xu, Shunan Zheng, Wei WangCost-Aware InferenceOffline RL

  4. Learning to Route Languages for Multilingual Policy Optimization

    May 25, 2026Geyang Guo, Hiromi Wakaki, Yuki Mitsufuji +2Multilingual Language ModelsRL for Language Models

  5. Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

    May 23, 2026Yuxin Zhang, Mengxue Hu, Zheng Lin +8LLM Agent TrainingLLM Routing

  6. Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

    May 22, 2026Md Nurul Absar SiddikyMixture-of-Experts Language ModelsExpert Routing

  7. ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

    May 21, 2026Aman Sunesh, Ali Alshehhi, Hivansh DhakneLLM Inference EfficiencyLLM Serving

  8. APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

    May 20, 2026Philipp Spohn, Leander Girrbach, Zeynep AkataLLM EvaluationLLM Personalization

  9. LogRouter: Adaptive Two-Level LLM Routing for Log Question Answering in Big Data Systems

    May 18, 2026Mert Coskuner, Merve Zeybel, Melik Mert DolanLLM Inference EfficiencyCost-Aware Inference

  10. Mixture of Experts for Low-Resource LLMs

    May 17, 2026Ori Bar Joseph, Smadar Arvatz, Noam Kayzer +2Mixture-of-Experts Language ModelsExpert Routing

  11. HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

    May 16, 2026Aashna Garg, Siddharth Singha Roy, Jinu Jang +2Cost-Aware InferenceLLM Routing

  12. Reasoning Can Be Restored by Correcting a Few Decision Tokens

    May 16, 2026Changshuo Shen, Leheng Sheng, Yuxin Chen +2Efficient Language Model ReasoningInference-Time Compute Allocation

  13. Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering

    May 15, 2026Jiachen Zhu, Zhuoying Ou, Congmin Zheng +9LLM PromptingLLM Routing

  14. BEAM: Binary Expert Activation Masking for Dynamic Routing in MoE

    May 14, 2026Juntong Wu, Jialiang Cheng, Qishen Yin +5Sparse Mixture-of-ExpertsMixture-of-Experts Inference

  15. CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference

    May 12, 2026Nan Xue, Shengkang Chen, Zhiyong Chen +4On-Device Language Model InferenceLLM Inference

  16. GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization

    May 12, 2026Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha +1LLM Inference EfficiencyConstrained Optimization

  17. LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

    May 11, 2026Xueqi Cheng, Yushun DongEfficient Multimodal InferenceMultimodal Large Language Models

  18. Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

    May 11, 2026Wenbo Zhang, Lijinghua Zhang, Liner Xiang +1LLM-as-a-JudgeCost-Aware Inference

  19. Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

    May 11, 2026Yiwen Chen, Kuan Li, Fuzhen Zhuang +6LLM PromptingLong-Context Modeling

  20. Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

    May 9, 2026Wenzhi Fang, Liangqi Yuan, Guangchen Lan +2Multi-Agent LLM SystemsMulti-Agent Coordination

  21. Large Language Models over Networks: Collaborative Intelligence under Resource Constraints

    May 9, 2026Liangqi Yuan, Wenzhi Fang, Shiqiang Wang +2LLM Inference EfficiencyOn-Device Language Model Inference

  22. Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

    May 8, 2026Saloni Garg, Amit SagtaniLLM EvaluationLLM-as-a-Judge

  23. When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models

    May 8, 2026Youngsik Yoon, Siwei Wang, Wei Chen +1Mixture-of-Experts Language ModelsLLM Routing

  24. Switchcraft: AI Model Router for Agentic Tool Calling

    May 8, 2026Sharad Agarwal, Pooria Namyar, Alec Wolman +3Tool-Augmented Language Model AgentsCost-Aware Inference