LLM Serving

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 143% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 144

All topics
CardsList
  1. Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving

    Jun 25, 2026Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana +11LLM ServingCost-Aware Inference

  2. FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

    Jun 22, 2026Yinpeng Wu, Yitong Chen, Lixiang Wang +3LLM ServingOn-Device Language Model Inference

  3. Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice

    Jun 21, 2026Li Kong, Qi Qi, Yinyu Ye +1LLM ServingLLM Inference Scheduling

  4. Recency/Frequency Adaptive KV Caching for Large Language Model Serving

    Jun 19, 2026Yang Shen, Meghana Madhyastha, Robert Underwood +2LLM ServingKV Caching

  5. Token-Operations-Oriented Inference Optimization Techniques for Large Models

    Jun 18, 2026Shiguo Lian, Kai Wang, Zhaoxiang Liu +22LLM ServingInference-Time Optimization

  6. Beyond Prediction: Tail-Aware Scheduling for LLM Inference

    Jun 16, 2026Yueying Li, Yuanfan Chen, Jiayang Chen +6LLM ServingInference-Time Optimization

  7. Service-Induced Congestion in Memory-Constrained LLM Serving

    Jun 14, 2026Ruicheng Ao, Jing Dong, Gan Luo +1LLM Inference EfficiencyLLM Serving

  8. Director: Accelerating Distributed MoE Serving via Online Proactive Expert Placement

    Jun 13, 2026Qianli Liu, Kaibin Guo, Zicong Hong +5Expert ParallelismLLM Serving

  9. STREAM: Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

    Jun 11, 2026Anas Nassar, Steve Mohr, Leonard Apanasevich +1LLM ServingLLM Inference

  10. Characterizing Software Aging in GPU-Based LLM Serving Systems

    Jun 10, 2026Domenico Cotroneo, Bojan CukicSoftware EngineeringLLM Serving

  11. K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

    Jun 9, 2026Zhiwei Tang, Yuanyu He, Yizheng Han +4LLM ServingLanguage Model Decoding

  12. AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

    Jun 8, 2026Rakibul Hasan Rajib, Mengxin Zheng, Qian LouLLM ServingKV-Cache Management

  13. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching

    Jun 5, 2026Qianli Ma, Zhiqing Tang, Hanshuai Cui +2LLM ServingKV Caching

  14. SPEAR: A System for Post-Quantization Error-Adaptive Recovery Enabling Efficient Low-Bit LLM Serving

    Jun 4, 2026Hongyuan Liu, Yawei Li, Zhiqiang Que +3LLM QuantizationLLM Serving

  15. Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

    Jun 4, 2026Zhuoming Chen, Xinrui Zhong, Qilong Feng +5LLM ServingLLM Inference Acceleration

  16. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

    Jun 4, 2026Yang Liu, ZhaoKai Luo, HuaYi Jin +5LLM ServingKV Caching

  17. Ekka: Automated Diagnosis of Silent Errors in LLM Inference

    Jun 3, 2026Yile Gu, Zhen Zhang, Shaowei Zhu +4Software EngineeringLLM Serving

  18. E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments

    Jun 2, 2026Truong-Thanh Le, Amir Taherkordi, Hoang-Loc La +3LLM ServingEdge Computing

  19. Inference-Native Zeroth-Order Optimization for LLMs

    May 27, 2026Zelin Li, Caiwen DingLLM ServingZeroth-Order Optimization

  20. How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving

    May 27, 2026Hanjiang Wu, Abhimanyu Rajeshkumar Bambhaniya, Sarbartha Banerjee +9LLM ServingLLM Inference

  21. RW-TTT: Batched Serving for Request-Owned Test-Time Training State

    May 27, 2026Jian Yang, Zhizhuo Kou, Yao Tian +4LLM ServingTest-Time Optimization

  22. A Policy-Driven Runtime Layer for Agentic LLM Serving

    May 26, 2026Rui Zhang, Chaeeun Kim, Liting HuLLM Inference EfficiencyMulti-Agent LLM Systems

  23. ReLoRA: Knowledge-Reusing Adaptation for Fast Rollout of Evolving LLM Services

    May 23, 2026Yang Xu, Zihuai Xu, Hongli Xu +3LLM ServingLLM Fine-Tuning