LLM Routing

LLM: Large Language Model

Momentum

30 papers in the last four weeks, up 88% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 224

All topics
CardsList
  1. Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration

    Jul 31, 2026Yanbin Fang, Xuan Wei, Wei ChenLLM RoutingMulti-LLM Collaboration

  2. FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA

    Jul 29, 2026Donghang Duan, Xu Zheng, Lizong Zhang +2Federated Learning AggregationLLM Routing

  3. Divergence Decoding: Training-Free Capability Fusion

    Jul 28, 2026Yimi Wang, Hao Li, Shuo Yang +6LLM RoutingScientific Reasoning in Language Models

  4. WISERouter: LLM Routing with Workload Budget Constraint

    Jul 26, 2026Yifei Li, Zihui Gao, Laks V. S. LakshmananLLM RoutingContextual Bandits

  5. SMART: LLM-Augmented Hybrid Retrieval for Dynamic Product Ads

    Jul 25, 2026Congfei Zhang, Jingxiao Ma, Xiaodong Liu +14Online AdvertisingAdaptive Retrieval

  6. TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI

    Jul 24, 2026Ritik Raj, Souvik Kundu, Sarbartha Banerjee +3LLM RoutingLLM Agent Routing

  7. TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis

    Jul 22, 2026Isabel Xu, Cynthia Xu, Rachel Ren +2Multi-Agent LLM SystemsFinancial Sentiment Analysis

  8. VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval

    Jul 20, 2026Yu-Chien Tang, Jun-Chen Hung, Wen-Chih Peng +1LLM Inference EfficiencyAdaptive Model Routing

  9. AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

    Jul 20, 2026Eu Jin Lim, Zhaoxing Li, Sebastian SteinAdaptive InferenceOn-Device Language Model Inference

  10. Multi-level context Modeling for consistent expert selection in Mixture-of-Experts

    Jul 17, 2026Shuhan Huang, Naifan Zhang, Yuanbo Tang +2Mixture-of-Experts Language ModelsExpert Routing

  11. ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

    Jul 17, 2026Vishal Pandey, Gopal SinghLLM ServingLLM Reliability

  12. Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

    Jul 15, 2026Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi +1Multi-Agent LLM SystemsLanguage Model-Based Control

  13. Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

    Jul 10, 2026Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi +1Multi-Armed BanditsLLM Routing

  14. Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models

    Jul 9, 2026Bishmoy Paul, Youngmin Yi, Hoeseok YangLLM PruningActivation Sparsity

  15. TSRouter: Dynamic Modality-Model Selection for Time Series Reasoning

    Jul 9, 2026Fangxu Yu, Tao Feng, Dehai Min +3Adaptive Model RoutingTime Series Reasoning

  16. Resample or Reroute? Recoverable Stopping Debt Without Identified Action Selection

    Jul 9, 2026Teng-Ruei ChenCode GenerationLLM Reliability

  17. TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation

    Jul 7, 2026Andrii Balashov, Olena PonomarovaSparse Mixture-of-ExpertsLLM Routing

  18. Mechanism-level routing failure in LLMs over Lean-verified algebraic structures

    Jul 5, 2026Manuel Israel Cázares, Wenlin Zhang, Haobo MaLLM ReliabilityLLM Routing

  19. Parametric Memory Decoding for Zero-Shot Routing in LoRA-Based External Parametric Memory

    Jul 5, 2026Fengxian Ji, Zhuohan Xie, Jingpu Yang +3Zero-Shot LearningMemory-Augmented Language Models

  20. Online Linear Programming for Multi-Objective Routing in LLM Serving

    Jul 4, 2026Zixi Chen, Yinyu Ye, Zijie ZhouLLM ServingLLM Routing

  21. What Does a Routing Oracle Measure Under Stochastic Decoding? Coupling, Scorer Choice, and Single-Commit Ceilings

    Jul 3, 2026Teng-Ruei ChenLLM EvaluationLanguage Model Decoding

  22. A Workflow-Aware Serving Layer for Agentic Applications

    Jul 3, 2026Jiayi Qian, Zishen Wan, Hanchen Yang +3Cost-Aware InferenceAgentic Workflows

  23. Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

    Jun 30, 2026Seyed Alireza Molavi, Zhan Su, Yan Hu +3Mixture-of-Experts Language ModelsLow-Rank Adaptation