LLM Inference Scheduling

LLM: Large Language Model

Latest papers 83

All topics
CardsList
  1. INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

    Jun 9, 2026Ahasan Kabir, Jiaqi Xue, Mengxin Zheng +1Multi-Agent System OptimizationMulti-Agent Orchestration

  2. AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

    Jun 7, 2026Yingxuan Ren, Yuxuan Lou, Yong Liu +4LLM Inference SchedulingBlockwise Diffusion Language Models

  3. NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference

    Jun 2, 2026Mubarak Adetunji OjewaleLLM InferenceKV Caching

  4. MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency

    Jun 2, 2026Saptarshi Mitra, Yifan Zhang, Rachid Karami +5LLM Inference EfficiencyMulti-Agent System Optimization

  5. Lodestar: An Online-Learning LLM Inference Router

    May 31, 2026Gangmuk Lim, Wanyu Zhao, Brighten Godfrey +3Inference-Time OptimizationLLM Inference Scheduling

  6. Threshold-Based Exclusive Batching for LLM Inference

    May 30, 2026Weifang Zhang, Yuzhou Nie, Bowen Pang +2GPU AccelerationLLM Inference

  7. ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

    May 21, 2026Aman Sunesh, Ali Alshehhi, Hivansh DhakneLLM Inference EfficiencyLLM Serving

  8. Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

    May 20, 2026Yicheng Feng, Xin Tan, Yangtao Deng +3LLM ServingDisaggregated LLM Serving

  9. TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload

    May 19, 2026Zhiben Chen, Youpeng Zhao, Yang Sui +2Expert OffloadingLLM Inference Scheduling

  10. Compute Where it Counts: Self Optimizing Language Models

    May 11, 2026Yash Akhauri, Mohamed S. AbdelfattahLLM Inference EfficiencyRL for Language Models

  11. Regulating Branch Parallelism in LLM Serving

    May 7, 2026Swapnil Gandhi, Siva Hari, William J. Dally +1LLM ServingLLM Inference Scheduling

  12. A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

    May 6, 2026Chengyi Nie, Nian Si, Zijie ZhouLLM ServingLLM Inference

  13. Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

    May 2, 2026Zijie ZhouLLM ServingLLM Inference

  14. Efficient, VRAM-Constrained xLM Inference on Clients

    Apr 29, 2026Aditya Ukarande, Deep Shekhar, Marc Blackstein +1GPU AccelerationEfficient VLM Inference

  15. Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines

    Apr 16, 2026Otto White, Marcel Wagenländer, Britannio Jarrett +7LLM InferenceLLM Inference Scheduling

  16. ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System

    Feb 14, 2026Hao Kang, Ziyang Li, Weili Xu +7LLM Agent OrchestrationLLM Inference Scheduling

  17. Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank

    Sep 25, 2025Yiheng Tao, Yihe Zhang, Matthew Dearing +4LLM ServingLearning to Rank

  18. LLM Serving Optimization with Variable Prefill and Decode Lengths

    Aug 8, 2025Meixuan Wang, Yinyu Ye, Zijie ZhouLLM ServingLLM Inference Scheduling

  19. Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters

    Apr 7, 2025Zonghang Li, Tao Li, Wenjiao Feng +8On-Device Language Model InferenceLLM Inference

  20. OUTLETS: Output-Length Prediction from Speculative Decoding Backbones

    Date pendingWeihuang Wen, Yingying Liu, Yichuan Liu +5LLM ServingLLM Inference Scheduling