Disaggregated LLM Serving

LLM: Large Language Model

Momentum

5 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 17

All topics
CardsList
  1. Evaluating Inference Compute for Generative AI: A Framework for Enterprise Workloads

    Oct 5, 2026Abbas Raza Ali, Muhammad Ajmal Siddiqui, Moona ZahidLLM Inference EfficiencyDisaggregated LLM Serving

  2. MAPS: Memory-Aware Predictive Scheduling Framework for Large Language Model Serving

    Sep 14, 2026Tiancheng Zhang, Yulin Chen, Yunfeng Zhao +3Disaggregated LLM ServingLLM Inference Scheduling

  3. Rethinking Heterogeneous System Disaggregation for Subquadratic Attention

    Sep 14, 2026Arya Tschand, Yaosheng Fu, Vikram Sharma Mailthody +6Disaggregated LLM ServingLLM Inference Acceleration

  4. AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

    Aug 5, 2026Chengyu Qiu, Xiao Fu, Fengcun Li +6Mixture-of-Experts Language ModelsDisaggregated LLM Serving

  5. Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

    Aug 3, 2026Cunchen Hu, Liangliang Xu, Tian Liu +9Energy-Efficient MLDisaggregated LLM Serving

  6. Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

    Jul 2, 2026Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj +2LLM ServingDisaggregated LLM Serving

  7. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching

    Jun 5, 2026Qianli Ma, Zhiqing Tang, Hanshuai Cui +2LLM ServingKV Caching

  8. How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving

    May 27, 2026Hanjiang Wu, Abhimanyu Rajeshkumar Bambhaniya, Sarbartha Banerjee +9LLM ServingLLM Inference

  9. Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

    May 20, 2026Yicheng Feng, Xin Tan, Yangtao Deng +3LLM ServingDisaggregated LLM Serving

  10. KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving

    May 13, 2026Zedong Liu, Xinyang Ma, Dejun Luo +9LLM ServingKV Caching

  11. SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

    May 3, 2026Yipin Guo, Siddharth JoshiLLM ServingKV Caching

  12. VoltanaLLM: Energy-Efficient and SLO-Aware Disaggregated LLM Serving via Adaptive Frequency Control and State-Space Routing

    Sep 5, 2025Jiahuan Yu, Aryan Taneja, Junfeng Lin +1LLM ServingEnergy-Efficient ML

  13. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

    Jun 24, 2024Ruoyu Qin, Zheming Li, Weiran He +4LLM ServingDisaggregated LLM Serving