LLM Serving

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 143% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 142

All topics
CardsList
  1. Characterizing High Bandwidth Flash for LLM Serving

    Sep 30, 2026Zack Yu, Chloe Wong, Coleman Hooper +7LLM Inference EfficiencyLLM Serving

  2. Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure

    Sep 30, 2026Matias Parij, Pawan Paudel, Tate Berenbaum +1LLM ServingLLM Inference Scheduling

  3. You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM Inference

    Sep 29, 2026Liang He, Jingbo Wen, Yixiong Chen +4LLM ServingCost-Aware Inference

  4. SPLASH: Switching Parallel Layouts of Attention with Seamless Handoff for LLM Serving

    Sep 29, 2026Chuan Liu, Shuoming Zhang, Zhicheng Li +6LLM ServingTensor Parallelism

  5. Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

    Sep 29, 2026Guannan Lai, Gelin Bian, Hao-Xuan Ma +5LLM ServingCost-Aware Inference

  6. Beyond Energy: When Sustainability Dimensions Reshape LLM Serving Decisions

    Sep 28, 2026Tianyao Shi, Xipeng Shen, Yi DingLLM Inference EfficiencyLLM Serving

  7. DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

    Sep 28, 2026Xuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2LLM ServingLLM Inference

  8. Does Execution Require Target KV Fidelity? A Mixed-Fidelity KV Runtime for LLM Serving

    Sep 27, 2026Jiantong Jiang, Yue Yang, Peiyu Yang +1LLM ServingKV-Cache Management

  9. Efficient Iterative Retrieval with Heterogeneous Batching

    Sep 21, 2026Dohyun Park, Hubertus Franke, Daniel G. Waddington +2Retrieval-Augmented GenerationLLM Serving

  10. Token Latency Fairness: Performance Isolation for Multi-Tenant LLM Serving

    Sep 16, 2026Dev Bali, Soujanya Ponnapalli, Yichuan Wang +3LLM ServingLLM Inference Scheduling

  11. Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

    Sep 7, 2026Siyu Song, Qi Bai, Jinbo Hao +3LLM ServingLLM Inference Scheduling

  12. The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

    Aug 25, 2026Elioth SanabriaLLM ServingLLM Inference Scheduling

  13. Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

    Aug 13, 2026Ahmet Bugra Gundogan, Yigit Turkmen, Melih BastopcuLLM ServingInference-Time Compute Allocation

  14. Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

    Aug 12, 2026Natchanon Pollertlam, Witchayut KornsuwannawitLLM ServingLLM Agent Memory

  15. LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving

    Aug 9, 2026Shuowei Jin, Xueshen Liu, Jiaxin Shan +4LLM Serving

  16. Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

    Aug 6, 2026Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair +4LLM ServingLLM Inference Scheduling

  17. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving

    Aug 4, 2026Xiang Li, Pengcheng Wang, Huazheng Wang +1LLM Inference EfficiencyLLM Serving

  18. RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

    Aug 4, 2026Haiqiang Zhang, Yuanqing Lei, Wanting Li +2Retrieval-Augmented GenerationLLM Serving

  19. LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

    Aug 4, 2026Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh +1LLM ServingLLM Inference Acceleration

  20. LaCache: Robust Semantic Caching for LLM Serving

    Aug 3, 2026Jiacheng Liang, Yuhui Wang, Tanqiu Jiang +1LLM ServingLLM Security