LLM Agent Serving

LLM: Large Language Model

Latest papers 20

All topics
CardsList
  1. Report: Progressive Disclosure of Agent Skills

    Sep 28, 2026Guilin Zhang, Kai Zhao, Priyanka Mudgal +4LLM Agent ServingLLM Agent Skill Retrieval

  2. EfficientAgent: What Makes KV Cache Offloading Work for Concurrent Agents?

    Sep 27, 2026Kunming Shao, Jierun Chen, Jiangnan Yu +7KV-Cache OffloadingKV-Cache Management

  3. Not All AI Agents Are Equal: Characterizing Resource and Performance Dynamics

    Sep 17, 2026Wonmi Choi, Minuk Park, Zhixiong Niu +3LLM Inference EfficiencyLLM Agent Workflow Optimization

  4. Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It

    Sep 16, 2026Yipeng Liu, Yingqiang Zhang, Feifei Li +1LLM Inference EfficiencyKV Caching

  5. AgentKV: Phase-Aware KV Eviction for Agentic LLMs

    Sep 14, 2026Taowen Tony Liu, Jeffrey T. H. Wong, Can Xiao +3KV CachingKV-Cache Eviction

  6. Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

    Aug 12, 2026Natchanon Pollertlam, Witchayut KornsuwannawitLLM ServingLLM Agent Memory

  7. SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

    Jul 27, 2026Yihui Zhang, Tianyu Wo, Jinghao Wang +7LLM Inference EfficiencyLLM Agent Serving

  8. SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling

    Jul 9, 2026Jiahao Wang, Kaizhan Lin, Kaixi Zhang +7LLM Inference SchedulingKV-Cache Management

  9. AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

    Jun 8, 2026Rakibul Hasan Rajib, Mengxin Zheng, Qian LouLLM ServingKV-Cache Management

  10. A Policy-Driven Runtime Layer for Agentic LLM Serving

    May 26, 2026Rui Zhang, Chaeeun Kim, Liting HuLLM Inference EfficiencyMulti-Agent LLM Systems

  11. GraphFlow: A Graph-Based Workflow Management for Efficient LLM-Agent Serving

    May 21, 2026Ao Li, Shangpeng Yang, Fahao Chen +3LLM Agent OrchestrationAgentic Workflows

  12. Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

    May 7, 2026Bole Ma, Jan Eitzinger, Harald KöstlerKV CachingLLM Inference Serving

  13. Pythia: Exploiting Workflow Predictability for Efficient Agent-Native LLM Serving

    Apr 28, 2026Shan Yu, Junyi Shu, Yuanjiang Ni +14LLM Inference EfficiencyMulti-Agent LLM Systems

  14. Nalar: Workflow-Aware Management of Agentic Applications

    Jan 8, 2026Saurabh Agarwal, Marco Laju, Donghyun Son +4LLM Inference EfficiencyLLM Agent Orchestration