LLM Serving

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 143% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 144

All topics
CardsList
  1. ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

    May 21, 2026Aman Sunesh, Ali Alshehhi, Hivansh DhakneLLM Inference EfficiencyLLM Serving

  2. Argo: Efficient Importance Labeling for Enterprise Email Systems

    May 20, 2026Siddhant Ray, Ganesh Ananthanarayanan, Kevin Chian +5LLM Inference EfficiencyLLM Serving

  3. PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

    May 20, 2026Can Hankendi, Rana Shahout, Minlan Yu +1LLM Inference EfficiencyLLM Serving

  4. Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

    May 20, 2026Yicheng Feng, Xin Tan, Yangtao Deng +3LLM ServingDisaggregated LLM Serving

  5. PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

    May 20, 2026Yiqi Zhang, Fangzheng Jiao, Tian Tang +13LLM Inference EfficiencyLLM Serving

  6. Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

    May 19, 2026Mert Yildiz, Pietro Spadaccino, Alexey Rolich +2LLM Inference EfficiencyLLM Serving

  7. An Interpretable Latency Model for Speculative Decoding in LLM Serving

    May 14, 2026Linghao Kong, Megan Flynn, Michael Peng +3LLM ServingSpeculative Decoding

  8. PreFT: Prefill-only finetuning for efficient inference

    May 14, 2026Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu +4Fine-TuningLLM Serving

  9. KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving

    May 13, 2026Zedong Liu, Xinyang Ma, Dejun Luo +9LLM ServingKV Caching

  10. MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters

    May 13, 2026H. Moore, S. Qi, D. Milojicic +2LLM ServingLLM Inference

  11. SOMA: Efficient Multi-turn LLM Serving via Small Language Model

    May 11, 2026Xueqi Cheng, Qiong Wu, Zhengyi Zhou +3LLM ServingSmall Language Models

  12. Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing

    May 11, 2026Yunze Zhao, Yibo Zhao, Yuchen Zhang +2LLM ServingLLM Security

  13. PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving

    May 10, 2026Bing Xie, Zhipeng Wang, Masahiro Tanaka +1LLM ServingKV Caching

  14. PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

    May 9, 2026Xingyu Qu, Tianhao Lin, Yiqi Li +2LLM ServingKV Caching

  15. Regulating Branch Parallelism in LLM Serving

    May 7, 2026Swapnil Gandhi, Siva Hari, William J. Dally +1LLM ServingLLM Inference Scheduling

  16. VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

    May 7, 2026Keisuke Kamahori, Shihang Li, Simon Peter +1Multi-Agent LLM SystemsLLM Serving

  17. A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

    May 6, 2026Chengyi Nie, Nian Si, Zijie ZhouLLM ServingLLM Inference

  18. Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs

    May 5, 2026Yixuan Mei, Zikun Li, Zixuan Chen +5LLM ServingCost-Aware Inference

  19. When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

    May 5, 2026Jiaqi Wei, Xuehang Guo, Pengfei Yu +5LLM ServingLLM Reasoning

  20. SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

    May 4, 2026Jincheng Xie, Yawen Ling, Qi Xiao +4LLM ServingSpeculative Decoding

  21. Human-Less LLM Serving: Quantifying the Human Tax on Throughput

    May 3, 2026Jianhui Lian, Li Chen, Dan Li +1LLM Inference EfficiencyLLM Serving

  22. SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

    May 3, 2026Yipin Guo, Siddharth JoshiLLM ServingKV Caching

  23. MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving

    May 3, 2026Zhaoyuan Su, Olatunji Ruwase, Karthik Ganesan +5Expert ParallelismLLM Serving

  24. Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

    May 2, 2026Zijie ZhouLLM ServingLLM Inference

  25. Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving

    Apr 30, 2026Junsun Choi, Sam Son, Sunjin Choi +5LLM ServingCost-Aware Inference

  26. FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving

    Apr 29, 2026Minghe Wang, Trever Schirmer, Mohammadreza Malekabbasi +1Mixture-of-Experts Language ModelsLLM Serving