LLM Inference Serving

LLM: Large Language Model

Momentum

6 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 51

All topics
CardsList
  1. Inference Auctions

    Sep 30, 2026Keegan Harris, Siddharth Prasad, Asher Trockman +2Mechanism DesignAutomated Bidding

  2. Spexis: Speculative Lookahead Scheduling for LLM Inference

    Sep 28, 2026Hyungyu Jung, Jaehyeok Yu, Hoonseo Choi +3LLM Inference EfficiencyLLM Inference Scheduling

  3. SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving

    Sep 22, 2026Jennifer Williams, Dave Farris, Jeff Farris +1Software EngineeringLLM Inference Serving

  4. Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It

    Sep 16, 2026Yipeng Liu, Yingqiang Zhang, Feifei Li +1LLM Inference EfficiencyKV Caching

  5. InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

    Aug 13, 2026Nicoletta Tsiopani, Moysis Symeonides, George Pallis +1Energy-Efficient MLLLM Inference Serving

  6. TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference

    Aug 3, 2026Ruilin Xu, Junyi Li, Pengfei Chen +1LLM InferenceLLM Inference Serving

  7. Kalypso: Relational LLM Serving

    Jul 26, 2026Hojae Son, Md Ashraful Islam, Huy Gia Cao +2LLM ServingLLM Inference Scheduling

  8. Automatic Model-Hardware Co-Adaptation for Heterogeneous AI Accelerators

    Jul 14, 2026Tian Chen, Mingheng Mi, Pu Wang +2AI Accelerator InferenceLLM Inference

  9. SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling

    Jul 9, 2026Jiahao Wang, Kaizhan Lin, Kaixi Zhang +7LLM Inference SchedulingKV-Cache Management

  10. Sangam: Efficiently Serving Diffusion LLMs with the AR Stack

    Jul 5, 2026Nitin Kedia, Saurabh Agarwal, Myungjin Lee +1LLM Inference SchedulingLLM Inference Serving

  11. KernelSight-LM: A Kernel-Level LLM Inference Simulator

    Jun 26, 2026Xiteng Yao, Taeho Kim, Hengzhi Pei +7LLM InferenceLLM Inference Serving

  12. Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators

    Jun 14, 2026Shun Usami, Venkatram Vishwanath, E. Wes BethelAI Accelerator InferenceLLM Inference

  13. INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

    Jun 9, 2026Ahasan Kabir, Jiaqi Xue, Mengxin Zheng +1Multi-Agent System OptimizationMulti-Agent Orchestration

  14. Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design

    Jun 9, 2026Wenxin Wang, Yule Hou, Yu Ji +2Expert ParallelismOn-Device Language Model Inference

  15. AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

    Jun 8, 2026Rakibul Hasan Rajib, Mengxin Zheng, Qian LouLLM ServingKV-Cache Management

  16. Breaking the Ice: Analyzing Cold Start Latency in vLLM

    Jun 5, 2026Huzaifa Shaaban Kabakibo, Animesh Trivedi, Lin WangLLM InferenceLLM Inference Serving

  17. MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency

    Jun 2, 2026Saptarshi Mitra, Yifan Zhang, Rachid Karami +5LLM Inference EfficiencyMulti-Agent System Optimization

  18. DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

    Jun 2, 2026Kathiravan PalaniappanLLM InferenceLLM Inference Serving

  19. Lodestar: An Online-Learning LLM Inference Router

    May 31, 2026Gangmuk Lim, Wanyu Zhao, Brighten Godfrey +3Inference-Time OptimizationLLM Inference Scheduling

  20. A Policy-Driven Runtime Layer for Agentic LLM Serving

    May 26, 2026Rui Zhang, Chaeeun Kim, Liting HuLLM Inference EfficiencyMulti-Agent LLM Systems