LLM Serving

LLM: Large Language Model

Momentum

17 papers in the last four weeks, up 143% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 144

All topics
CardsList
  1. TokenRouter: Efficient Serving System for Token-Level LLM Routing

    Oct 8, 2026Tianyu Fu, Tengxuan Liu, Ruoxi Wang +4LLM ServingLLM Routing

  2. Characterizing High Bandwidth Flash for LLM Serving

    Sep 30, 2026Zack Yu, Chloe Wong, Coleman Hooper +7LLM Inference EfficiencyLLM Serving

  3. Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure

    Sep 30, 2026Matias Parij, Pawan Paudel, Tate Berenbaum +1LLM ServingLLM Inference Scheduling

  4. You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM Inference

    Sep 29, 2026Liang He, Jingbo Wen, Yixiong Chen +4LLM ServingCost-Aware Inference

  5. SPLASH: Switching Parallel Layouts of Attention with Seamless Handoff for LLM Serving

    Sep 29, 2026Chuan Liu, Shuoming Zhang, Zhicheng Li +6LLM ServingTensor Parallelism

  6. Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

    Sep 29, 2026Guannan Lai, Gelin Bian, Hao-Xuan Ma +5LLM ServingCost-Aware Inference

  7. Beyond Energy: When Sustainability Dimensions Reshape LLM Serving Decisions

    Sep 28, 2026Tianyao Shi, Xipeng Shen, Yi DingLLM Inference EfficiencyLLM Serving

  8. DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

    Sep 28, 2026Xuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2LLM ServingLLM Inference

  9. Does Execution Require Target KV Fidelity? A Mixed-Fidelity KV Runtime for LLM Serving

    Sep 27, 2026Jiantong Jiang, Yue Yang, Peiyu Yang +1LLM ServingKV-Cache Management

  10. Efficient Iterative Retrieval with Heterogeneous Batching

    Sep 21, 2026Dohyun Park, Hubertus Franke, Daniel G. Waddington +2Retrieval-Augmented GenerationLLM Serving

  11. Token Latency Fairness: Performance Isolation for Multi-Tenant LLM Serving

    Sep 16, 2026Dev Bali, Soujanya Ponnapalli, Yichuan Wang +3LLM ServingLLM Inference Scheduling

  12. Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

    Sep 7, 2026Siyu Song, Qi Bai, Jinbo Hao +3LLM ServingLLM Inference Scheduling

  13. The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

    Aug 25, 2026Elioth SanabriaLLM ServingLLM Inference Scheduling

  14. Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

    Aug 13, 2026Ahmet Bugra Gundogan, Yigit Turkmen, Melih BastopcuLLM ServingInference-Time Compute Allocation

  15. Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

    Aug 12, 2026Natchanon Pollertlam, Witchayut KornsuwannawitLLM ServingLLM Agent Memory

  16. LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving

    Aug 9, 2026Shuowei Jin, Xueshen Liu, Jiaxin Shan +4LLM Serving

  17. Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

    Aug 6, 2026Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair +4LLM ServingLLM Inference Scheduling

  18. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving

    Aug 4, 2026Xiang Li, Pengcheng Wang, Huazheng Wang +1LLM Inference EfficiencyLLM Serving

  19. RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

    Aug 4, 2026Haiqiang Zhang, Yuanqing Lei, Wanting Li +2Retrieval-Augmented GenerationLLM Serving

  20. LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

    Aug 4, 2026Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh +1LLM ServingLLM Inference Acceleration