LLM Routing

LLM: Large Language Model

Momentum

30 papers in the last four weeks, up 88% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 224

All topics
CardsList
  1. VIA-SD: Verification via Intra-Model Routing for Speculative Decoding

    Jun 10, 2026Yuchen Xian, Yang He, Yunqiu Xu +1Speculative DecodingLLM Inference Acceleration

  2. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Multi-Objective Reinforcement LearningRL for Language Models

  3. Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs

    Jun 9, 2026Ruixuan Huang, Jinyuan Shi, Hantao Huang +5Continual Learning for LLMsLLM Compression

  4. BUDDY: BUdget-Driven DYnamic Depth Routing for Adaptive Large Language Model Inference

    Jun 8, 2026Yuhua Zhou, Shaoqi Yu, Shichao Weng +4LLM PruningCost-Aware Inference

  5. Online Pandora's Box for Contextual LLM Cascading

    Jun 5, 2026Alexandre Belloni, Yan Chen, Yehua WeiLLM Decision-MakingLLM Routing

  6. From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing

    Jun 5, 2026Guannan Lai, Haoran Hu, Long Chen +2LLM EvaluationLLM Routing

  7. Learning to Route LLMs from Implicit Cost-Performance Preferences via Meta-Learning

    Jun 4, 2026Jiahao Zeng, Ming Tang, Ningning DingMeta-LearningCost-Aware Inference

  8. Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

    Jun 3, 2026Nizar Islah, Istabrak Abbes, Irina Rish +2Test-Time ScalingLLM Routing

  9. RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents

    Jun 2, 2026Sonali Goel, Pranav Vaidhyanathan, Lucas Schorling +2Continual Learning for LLM AgentsLLM Routing

  10. From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Worlds

    Jun 2, 2026Louis Nisiotis, Aimilios HadjiliasiLLM Agent OrchestrationSmall Language Models

  11. When Model Merging Breaks Routing: Training-Free Calibration for MoE

    Jun 2, 2026Canbin Huang, Tianyuan Shi, Xiaojun Quan +3Mixture of ExpertsLLM Routing

  12. RASER: Recoverability-Aware Selective Escalation Router for Multi-Hop Question Answering

    Jun 1, 2026Yuyang Li, Zihe Yan, Tobias KäferMulti-Hop QALLM Inference Efficiency

  13. Lodestar: An Online-Learning LLM Inference Router

    May 31, 2026Gangmuk Lim, Wanyu Zhao, Brighten Godfrey +3Inference-Time OptimizationLLM Inference Scheduling

  14. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

    May 29, 2026Daize Dong, Junlin Chen, Haolong Jia +9RL for Language Model ReasoningExpert Routing

  15. Eigenvectors of Experts are Training-free Non-collapsing Routers

    May 29, 2026Giang Do, Hung Le, Truyen TranParameter-Free Mixture-of-Experts RoutingMixture of Experts

  16. UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling

    May 29, 2026Kaiyu Huang, Xingyu Wang, Mingze Kong +6Cost-Aware InferenceInference-Time Scaling

  17. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6LLM Safety BenchmarksLLM Guardrails

  18. A Dual-Path Architecture for Scaling Compute and Capacity in LLMs

    May 28, 2026Markus Frey, Behzad Shomali, Joachim Koehler +1Recurrent TransformersLanguage Model Scaling

  19. Leveraging Routing Dynamics in Mixture-of-Experts Models for Efficient Language Adaptation

    May 28, 2026Aditi Khandelwal, Marius Mosbach, Verna Dankers +2Multilingual Language ModelsContinual Learning for LLMs

  20. DynaGraph: Lightweight Multi-Model Interaction Framework via Dynamic Topological Reconfiguration

    May 28, 2026Yanxing Guo, Zihao Zheng, Fangzhou Wu +4Multi-Agent LLM SystemsLLM Routing

  21. Rethinking Stepwise Model Routing: A Cost-Efficient Table Reasoning Perspective

    May 28, 2026Shenghao Ye, Yuxiang Wang, Yu Guo +3Cost-Aware InferenceLLM Uncertainty Estimation

  22. Rubric-Guided Process Reward for Stepwise Model Routing

    May 28, 2026Shenghao Ye, Yu Guo, Zhengheng Li +2Process Reward ModelsRL for Language Model Reasoning

  23. The Routing Plateau: Understanding the Accuracy Limits of LLM Routers

    May 27, 2026Yifan Lu, Qiyue Zhang, Shenrun Zhang +4LLM EvaluationAdaptive Model Routing

  24. HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

    May 27, 2026Yansong Ning, Mianpeng Liu, Jingwen Ye +2LLM EvaluationAdaptive Inference