LLM Inference Scheduling

LLM: Large Language Model

Latest papers 82

All topics
CardsList
  1. Inference Auctions

    Sep 30, 2026Keegan Harris, Siddharth Prasad, Asher Trockman +2Mechanism DesignAutomated Bidding

  2. Characterizing High Bandwidth Flash for LLM Serving

    Sep 30, 2026Zack Yu, Chloe Wong, Coleman Hooper +7LLM Inference EfficiencyLLM Serving

  3. Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure

    Sep 30, 2026Matias Parij, Pawan Paudel, Tate Berenbaum +1LLM ServingLLM Inference Scheduling

  4. SPLASH: Switching Parallel Layouts of Attention with Seamless Handoff for LLM Serving

    Sep 29, 2026Chuan Liu, Shuoming Zhang, Zhicheng Li +6LLM ServingTensor Parallelism

  5. Nereus: Adaptive Parallelism for LLM Post-Training

    Sep 28, 2026Songlin Jiang, Tuo Shi, Sitong Zhang +3LLM Inference SchedulingRL Post-Training

  6. PulseInfer: I/O-Centric Sparse KV Cache Offloading for Efficient Long-Context LLM Decoding

    Sep 28, 2026Qiuyang Zhang, Kai Zhou, Kai Lu +6KV-Cache OffloadingLong-Context Language Model Inference

  7. Reciprocal Guidance: Orchestrating Draft and Verify Budgets for Advancing the Diffusion-AR Self-Speculation Frontier

    Sep 28, 2026Linye Wei, Shutian Zheng, Haoyu Zeng +1LLM Inference SchedulingSpeculative Decoding

  8. Spexis: Speculative Lookahead Scheduling for LLM Inference

    Sep 28, 2026Hyungyu Jung, Jaehyeok Yu, Hoonseo Choi +3LLM Inference EfficiencyLLM Inference Scheduling

  9. FORGE: Form-Optimal Routing of Grounded Evidence for Frozen LLM Agents

    Sep 28, 2026Xi Xiao, Yunbei Zhang, Chen Liu +7LLM GroundingLLM Inference Scheduling

  10. Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    Sep 28, 2026Murtaza Rangwala, Richard O. Sinnott, Rajkumar BuyyaLLM InferenceLLM Inference Scheduling

  11. Efficient Iterative Retrieval with Heterogeneous Batching

    Sep 21, 2026Dohyun Park, Hubertus Franke, Daniel G. Waddington +2Retrieval-Augmented GenerationLLM Serving

  12. PrefixBench-H100: Characterizing Prefix Reuse and Time-to-First-Token in H100 LLM Serving

    Sep 17, 2026Omkar Shewale, Deepak Kumar, Divakar Kumar YadavLLM Inference EfficiencyLLM Inference

  13. Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling

    Sep 16, 2026Mobina Kashaniyan, Ali JannesariLLM Inference EfficiencyLLM Inference

  14. Token Latency Fairness: Performance Isolation for Multi-Tenant LLM Serving

    Sep 16, 2026Dev Bali, Soujanya Ponnapalli, Yichuan Wang +3LLM ServingLLM Inference Scheduling

  15. ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

    Sep 16, 2026Amir Ziashahabi, Hossein Entezari Zarch, Lei Gao +2Long-Context Language Model InferenceLLM Inference Scheduling

  16. MAPS: Memory-Aware Predictive Scheduling Framework for Large Language Model Serving

    Sep 14, 2026Tiancheng Zhang, Yulin Chen, Yunfeng Zhao +3Disaggregated LLM ServingLLM Inference Scheduling

  17. SeqMoE: Toward Full-Load Performance via Predictive and Graph-Compatible MoE Offloading

    Sep 14, 2026Zihan Wang, Yuqi Wang, Lei Gong +5Expert OffloadingLLM Inference Scheduling

  18. Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows

    Sep 12, 2026Bochao Feng, Jianjiang Li, Haojie Wang +4LLM Inference SchedulingAgentic Workflows

  19. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKV-Cache OffloadingKV Caching

  20. Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

    Sep 7, 2026Siyu Song, Qi Bai, Jinbo Hao +3LLM ServingLLM Inference Scheduling

  21. CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

    Sep 1, 2026Chaohui Guo, Michel Klein, Zhisheng HuangReinforcement LearningLLM Inference Scheduling

  22. DynaNDE: Dynamic Near-Data Expert Scheduling for Batched MoE Inference

    Aug 31, 2026Xiaoyang Lu, Belthangady Akash Vi Narayana Pai, Xian-He SunEfficient Neural Network InferenceLLM Inference Scheduling

  23. The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

    Aug 25, 2026Elioth SanabriaLLM ServingLLM Inference Scheduling

  24. Scheduling Mixed RL Rollouts Beyond Prefix Locality

    Aug 11, 2026Zetao Hong, Song Yuan, Yuanhao Ding +4LLM Inference SchedulingKV-Cache Management

  25. ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover

    Aug 11, 2026Minwoo Kim, Soochang Song, Namyoon Lee +2KV CachingEdge Computing

  26. MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

    Aug 11, 2026Eunjeong Kim, Yeong Jun Jeon, Myeonggyun HanOn-Device Language Model InferenceLLM Inference Scheduling

  27. Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

    Aug 10, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisLLM InferenceLLM Inference Scheduling

  28. Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

    Aug 6, 2026Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair +4LLM ServingLLM Inference Scheduling

  29. LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm

    Aug 6, 2026Anjali Gangadhar Katageria, Shobha Rani, Raghu Nandan SenguptaLLM Inference SchedulingOnline Resource Allocation

  30. BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

    Aug 6, 2026Guanqiao Qu, Shuo Chen, Qian Chen +2Edge ComputingLLM Inference Scheduling

  31. Architectural Implications of Agentic AI Workflows

    Aug 5, 2026Jirong Yang, Peizhe Liu, Chaojie Zhang +1LLM Inference SchedulingAgentic Workflows

  32. Learning-Based Collaborative MEC for LLM Inference with Soft-Deadline Awareness via Transformer-Enhanced PPO

    Aug 3, 2026Ngoc Hung Nguyen, Bjorn LandfeldtReinforcement LearningTransformer-Based RL

  33. Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

    Aug 3, 2026Cunchen Hu, Liangliang Xu, Tian Liu +9Energy-Efficient MLDisaggregated LLM Serving

  34. DeltaServe: Host-Agnostic Co-Serving of Inference and Fine-Tuning for LLMs

    Jul 30, 2026Jiaxuan Chen, Jianshu She, Ye Yuan +5LLM ServingLLM Fine-Tuning

  35. Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

    Jul 30, 2026Banruo Liu, Haoran Qiu, Íñigo Goiri +3LLM InferenceAI Coding Agents

  36. Incast-Free MoE Rate-Based Scheduling

    Jul 28, 2026Evyatar Cohen, Jose Yallouz, Alexander Shpiner +3LLM Inference SchedulingMixture-of-Experts Inference

  37. Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

    Jul 27, 2026Yifan Dou, Shikan Lian, Shibo LiLLM Inference EfficiencyLLM Inference Scheduling

  38. Kalypso: Relational LLM Serving

    Jul 26, 2026Hojae Son, Md Ashraful Islam, Huy Gia Cao +2LLM ServingLLM Inference Scheduling

  39. An MLIR-Based Compilation Method for Large Language Models

    Jul 17, 2026Pengchao Hu, Zhibin Xin, Yifan Chen +3LLM ServingLLM Inference Scheduling

  40. Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices

    Jul 11, 2026Yangyijian Liu, Hongyi Ye, Mingyang Li +1On-Device Language Model InferenceLLM Inference Scheduling

  41. SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling

    Jul 9, 2026Jiahao Wang, Kaizhan Lin, Kaixi Zhang +7LLM Inference SchedulingKV-Cache Management

  42. Sangam: Efficiently Serving Diffusion LLMs with the AR Stack

    Jul 5, 2026Nitin Kedia, Saurabh Agarwal, Myungjin Lee +1LLM Inference SchedulingLLM Inference Serving

  43. Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

    Jun 22, 2026Jiawei Xu, Minghui Liu, Aakriti Agrawal +2Masked Diffusion ModelsLanguage Model Decoding

  44. Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice

    Jun 21, 2026Li Kong, Qi Qi, Yinyu Ye +1LLM ServingLLM Inference Scheduling

  45. Beyond Prediction: Tail-Aware Scheduling for LLM Inference

    Jun 16, 2026Yueying Li, Yuanfan Chen, Jiayang Chen +6LLM ServingInference-Time Optimization