LLM Serving

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 143% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 144

All topics
CardsList
  1. LaCache: Robust Semantic Caching for LLM Serving

    Aug 3, 2026Jiacheng Liang, Yuhui Wang, Tanqiu Jiang +1LLM ServingLLM Security

  2. AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

    Aug 1, 2026Qunhui ZhangLLM ServingLLM Agent Orchestration

  3. Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces

    Aug 1, 2026Liming Liu, Chao Hu, Mingfei Lu +7LLM Serving

  4. Unleashing the Potential of Large Language Models: A Blueprint for Real-Time, Enterprise-Ready Deployments

    Aug 1, 2026Muhammad Faizan Raza, Shuo, Yang +2Retrieval-Augmented GenerationContinual Learning for LLMs

  5. TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

    Jul 31, 2026Zhenyu Zhang, Zhichao CaoLLM ServingLLM Inference Acceleration

  6. DeltaServe: Host-Agnostic Co-Serving of Inference and Fine-Tuning for LLMs

    Jul 30, 2026Jiaxuan Chen, Jianshu She, Ye Yuan +5LLM ServingLLM Fine-Tuning

  7. InferScale: GPU-Native KV Injection for Personalized LLM Serving

    Jul 29, 2026Peter Li, Prashant PandeyLLM ServingMemory-Augmented Language Models

  8. LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving

    Jul 29, 2026Ming-Yen Lee, Hanchen Yang, Faaiq Waqar +4LLM Inference EfficiencyLLM Serving

  9. KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

    Jul 27, 2026Shuo Wang, Fang Xi, Wenyuan Huang +2LLM ServingKV-Cache Management

  10. Kalypso: Relational LLM Serving

    Jul 26, 2026Hojae Son, Md Ashraful Islam, Huy Gia Cao +2LLM ServingLLM Inference Scheduling

  11. FailureAtlas: A Taxonomy of Failure Modes in Multi-Provider LLM Serving Infrastructure

    Jul 20, 2026Vishal Pandey, Gopal SinghLLM ServingLLM Reliability

  12. ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

    Jul 17, 2026Vishal Pandey, Gopal SinghLLM ServingLLM Reliability

  13. An MLIR-Based Compilation Method for Large Language Models

    Jul 17, 2026Pengchao Hu, Zhibin Xin, Yifan Chen +3LLM ServingLLM Inference Scheduling

  14. Supervised Fine-Tuning vs. In-Context Learning: An Equilibrium Analysis of LLM Personalization under Congestion

    Jul 15, 2026Fengzhuo Zhang, Zhuoran Yang, Dirk BergemannSupervised Fine-TuningLLM Serving

  15. Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

    Jul 13, 2026Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei LeeLLM ServingSoftware Engineering Agents

  16. Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations

    Jul 10, 2026Nada Zine, Tristan Coignion, Vincenzo Stoico +3LLM Inference EfficiencyLLM Evaluation

  17. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1LLM Inference EfficiencyLLM Serving

  18. Akashic: A Low-Overhead LLM Inference Service with MemAttention

    Jul 7, 2026Yang Liu, Zhaokai Luo, Huayi Jin +7LLM ServingMemory-Augmented Language Models

  19. DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

    Jul 6, 2026Xin Cheng, Xingkai Yu, Chenze Shao +30LLM ServingSpeculative Decoding

  20. Online Linear Programming for Multi-Objective Routing in LLM Serving

    Jul 4, 2026Zixi Chen, Yinyu Ye, Zijie ZhouLLM ServingLLM Routing

  21. Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

    Jul 2, 2026Jiaying Meng, Bojie LiLLM ServingKV Caching

  22. Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

    Jul 2, 2026Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj +2LLM ServingDisaggregated LLM Serving

  23. From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

    Jun 30, 2026Jie Li, Tongyang Wang, Yong ChenLLM Inference EfficiencyLLM Serving

  24. TraceLab: Characterizing Coding Agent Workloads for LLM Serving

    Jun 29, 2026Kan Zhu, Mathew Jacob, Chenxi Ma +4LLM ServingAI Coding Agents

  25. DiLaServe: High SLO Attainment Serving for Diffusion Language Models

    Jun 27, 2026Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham +1LLM ServingDiffusion Model Serving