LLM Inference Scheduling

LLM: Large Language Model

Latest papers 83

All topics
CardsList
  1. Inference Auctions

    Sep 30, 2026Keegan Harris, Siddharth Prasad, Asher Trockman +2Mechanism DesignAutomated Bidding

  2. Characterizing High Bandwidth Flash for LLM Serving

    Sep 30, 2026Zack Yu, Chloe Wong, Coleman Hooper +7LLM Inference EfficiencyLLM Serving

  3. Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure

    Sep 30, 2026Matias Parij, Pawan Paudel, Tate Berenbaum +1LLM ServingLLM Inference Scheduling

  4. SPLASH: Switching Parallel Layouts of Attention with Seamless Handoff for LLM Serving

    Sep 29, 2026Chuan Liu, Shuoming Zhang, Zhicheng Li +6LLM ServingTensor Parallelism

  5. Nereus: Adaptive Parallelism for LLM Post-Training

    Sep 28, 2026Songlin Jiang, Tuo Shi, Sitong Zhang +3LLM Inference SchedulingRL Post-Training

  6. PulseInfer: I/O-Centric Sparse KV Cache Offloading for Efficient Long-Context LLM Decoding

    Sep 28, 2026Qiuyang Zhang, Kai Zhou, Kai Lu +6KV-Cache OffloadingLong-Context Language Model Inference

  7. Reciprocal Guidance: Orchestrating Draft and Verify Budgets for Advancing the Diffusion-AR Self-Speculation Frontier

    Sep 28, 2026Linye Wei, Shutian Zheng, Haoyu Zeng +1LLM Inference SchedulingSpeculative Decoding

  8. Spexis: Speculative Lookahead Scheduling for LLM Inference

    Sep 28, 2026Hyungyu Jung, Jaehyeok Yu, Hoonseo Choi +3LLM Inference EfficiencyLLM Inference Scheduling

  9. FORGE: Form-Optimal Routing of Grounded Evidence for Frozen LLM Agents

    Sep 28, 2026Xi Xiao, Yunbei Zhang, Chen Liu +7LLM GroundingLLM Inference Scheduling

  10. Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    Sep 28, 2026Murtaza Rangwala, Richard O. Sinnott, Rajkumar BuyyaLLM InferenceLLM Inference Scheduling

  11. Efficient Iterative Retrieval with Heterogeneous Batching

    Sep 21, 2026Dohyun Park, Hubertus Franke, Daniel G. Waddington +2Retrieval-Augmented GenerationLLM Serving

  12. PrefixBench-H100: Characterizing Prefix Reuse and Time-to-First-Token in H100 LLM Serving

    Sep 17, 2026Omkar Shewale, Deepak Kumar, Divakar Kumar YadavLLM Inference EfficiencyLLM Inference

  13. Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling

    Sep 16, 2026Mobina Kashaniyan, Ali JannesariLLM Inference EfficiencyLLM Inference

  14. Token Latency Fairness: Performance Isolation for Multi-Tenant LLM Serving

    Sep 16, 2026Dev Bali, Soujanya Ponnapalli, Yichuan Wang +3LLM ServingLLM Inference Scheduling

  15. ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

    Sep 16, 2026Amir Ziashahabi, Hossein Entezari Zarch, Lei Gao +2Long-Context Language Model InferenceLLM Inference Scheduling

  16. MAPS: Memory-Aware Predictive Scheduling Framework for Large Language Model Serving

    Sep 14, 2026Tiancheng Zhang, Yulin Chen, Yunfeng Zhao +3Disaggregated LLM ServingLLM Inference Scheduling

  17. SeqMoE: Toward Full-Load Performance via Predictive and Graph-Compatible MoE Offloading

    Sep 14, 2026Zihan Wang, Yuqi Wang, Lei Gong +5Expert OffloadingLLM Inference Scheduling

  18. Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows

    Sep 12, 2026Bochao Feng, Jianjiang Li, Haojie Wang +4LLM Inference SchedulingAgentic Workflows

  19. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKV-Cache OffloadingKV Caching

  20. Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

    Sep 7, 2026Siyu Song, Qi Bai, Jinbo Hao +3LLM ServingLLM Inference Scheduling

  21. CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

    Sep 1, 2026Chaohui Guo, Michel Klein, Zhisheng HuangReinforcement LearningLLM Inference Scheduling

  22. DynaNDE: Dynamic Near-Data Expert Scheduling for Batched MoE Inference

    Aug 31, 2026Xiaoyang Lu, Belthangady Akash Vi Narayana Pai, Xian-He SunEfficient Neural Network InferenceLLM Inference Scheduling

  23. The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

    Aug 25, 2026Elioth SanabriaLLM ServingLLM Inference Scheduling