LLM Routing

LLM: Large Language Model

Momentum

30 papers in the last four weeks, up 88% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 224

All topics
CardsList
  1. Streaming Model Cascades for Semantic SQL

    Apr 1, 2026Paweł Liskowski, Kyle SchmausCost-Aware InferenceLLM Routing

  2. Self-Routing: Parameter-Free Expert Routing from Hidden States

    Apr 1, 2026Jama Hussein Mohamud, Drew Wagner, Mirco RavanelliParameter-Free Mixture-of-Experts RoutingLLM Routing

  3. ReLope: From Hidden-State Probing to a Decision Module for Multimodal LLM Routing

    Mar 25, 2026Yaopei Zeng, Congchao Wang, Blake JianHang Chen +1Multimodal Large Language ModelsLLM Routing

  4. Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey

    Feb 23, 2026Yasmin Moslem, John D. KelleherLLM RoutingEfficient Language Model Inference

  5. Disentangling Intrinsic Importance from Emergent Structure in Multi-Expert Orchestration

    Feb 4, 2026Sudipto Ghosh, Sujoy Nath, Sunny Manchanda +1Multi-Agent OrchestrationLLM Routing

  6. Learning to Route and Schedule LLMs from User Retrials via Contextual Queueing Bandits

    Feb 2, 2026Seoungbin Bae, Junyoung Son, Dabeen LeeLLM ServingLLM Routing

  7. Poodle: Seamlessly Scaling Down Large Language Models with Just-in-Time Model Replacement

    Dec 5, 2025Nils Strassenburg, Boris Glavic, Tilmann RablCost-Aware InferenceSmall Language Models

  8. GMTRouter: Personalized LLM Router over Multi-turn User Interactions

    Oct 29, 2025Yihang Sun, Encheng Xie, Tao Feng +1LLM PersonalizationLLM Routing

  9. VoltanaLLM: Energy-Efficient and SLO-Aware Disaggregated LLM Serving via Adaptive Frequency Control and State-Space Routing

    Sep 5, 2025Jiahuan Yu, Aryan Taneja, Junfeng Lin +1LLM ServingEnergy-Efficient ML

  10. FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

    Jul 14, 2025Tao Feng, Haozhen Zhang, Zijie Lei +5LLM EvaluationLLM Routing

  11. MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

    May 30, 2025Jingyan Shen, Jiarui Yao, Rui Yang +5Pairwise Preference LearningReward Modeling

  12. PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving

    Date pendingLin Huang, Yujuan Tan, Weisheng Li +4Retrieval-Augmented GenerationInference-Time Optimization