Distributed Inference

Latest papers 55

All topics
CardsList
  1. Cascadia: A Control-Plane-Free Alternative to Hyperconverged AI Infrastructure

    Sep 30, 2026Matias Parij, Pawan Paudel, Tate Berenbaum +1LLM ServingLLM Inference Scheduling

  2. Purlin: Separating Orchestration from the Datapath of Collectives

    Sep 29, 2026Osayamen Jonathan Aimuyo, Swapnil Gandhi, Christos KozyrakisLLM Inference EfficiencyHigh-Performance Computing

  3. Reliability Testing of Medical Model Performance under Distributed Deployment

    Sep 29, 2026Yifei Wang, Xiaohan Zhang, Youtao Ding +4Multimodal Model EvaluationDistributed Inference

  4. Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    Sep 28, 2026Murtaza Rangwala, Richard O. Sinnott, Rajkumar BuyyaLLM InferenceLLM Inference Scheduling

  5. Recovering Governing Dynamics from Distributed Observations via Exact Spline Merging

    Sep 15, 2026Naveen MysorePDE DiscoveryDistributed Inference

  6. Composable CXL Memory as a Kubernetes-Native Shared Memory for LLM Serving

    Sep 9, 2026Hongjian Fan, Kevin Zhang, David Habinsky +1LLM Inference EfficiencyKV Caching

  7. A Fundamental Limit in Decentralized Decision-Making

    Sep 7, 2026Marco Carpentiero, Felice Scala, Vincenzo Matta +1ClassificationDistributed Inference

  8. Manifold-Aware General Coded Computing for Straggler-Resilient Distributed Computing

    Sep 1, 2026Parsa Moradi, Mohammad Ali Maddah-AliDistributed Inference

  9. User-Assisted Collaborative Distributed Inference for Efficient QoS-Aware Autoscaling

    Aug 12, 2026Alfreds Lapkovskis, Ali Beikmohammadi, Sindri Magnússon +1Distributed InferenceOnline Resource Allocation

  10. HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference

    Aug 1, 2026Xin Yuan, Ning Li, Wenchao Xu +2Edge InferenceCost-Aware Inference

  11. Denial of Deadline: Network-Driven Accuracy Collapse in Distributed Inference Pipelines

    Jul 27, 2026Jhonatan Tavori, Gur-Eyal Sela, Ion Stoica +1Adversarial AttacksEdge Computing

  12. Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs

    Jul 25, 2026Zhihao Xu, Hao Zhong, Zeting Zhou +9Heterogeneous ComputingDistributed Inference

  13. Integrity of peer-to-peer distributed LLM inference under malicious nodes

    Jul 21, 2026Mert Cihangiroglu, Antonino NoceraLLM SecurityDistributed Inference

  14. DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

    Jul 17, 2026Yuyang Chen, Runxin Zhong, Zan Zong +3Diffusion TransformerEfficient Attention

  15. Stateful Worlds, Stateless Elasticity: Exact-State Serving for Interactive World Models

    Jul 11, 2026Jin Li, Jiawei ChenDistributed InferenceOnline Resource Allocation

  16. CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems

    Jul 8, 2026Tingkai Liu, Muralidhar Andoorveedu, Sanjoy Das +2GPU Kernel OptimizationHigh-Performance Computing

  17. Design-CP: Context Parallelism for Design of Protein Nanoparticles

    Jul 3, 2026Lorenzo Tarricone, Helen E. Eisenach, Aiko Muraishi +1GPU AccelerationHigh-Performance Computing

  18. From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

    Jun 30, 2026Jie Li, Tongyang Wang, Yong ChenLLM Inference EfficiencyLLM Serving

  19. Privacy-preserving federated tensor decomposition of single-cell immune data: recovering multicellular programs across institutions

    Jun 22, 2026Axel Faes, Stephanie M. van den Berg, Maryam Amir HaeriFederated Learning AggregationTensor Decomposition

  20. BatchGen: An Architecture for Scalable and Efficient Batch Inference

    Jun 19, 2026Tairan Xu, Leyang Xue, Zhan Lu +7Efficient Neural Network InferenceEfficient Inference

  21. AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers

    Jun 16, 2026Kaijian Wang, Yuanyuan Xu, Fanjiang Ye +5AI Accelerator InferenceVideo Diffusion Models

  22. Director: Accelerating Distributed MoE Serving via Online Proactive Expert Placement

    Jun 13, 2026Qianli Liu, Kaibin Guo, Zicong Hong +5Expert ParallelismLLM Serving

  23. M*: A Modular, Extensible, Serving System for Multimodal Models

    Jun 10, 2026Atindra Jha, Naomi Sagan, Keisuke Kamahori +9Efficient Multimodal InferenceDistributed Inference

  24. Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Edge

    Jun 3, 2026Haotian Zheng, Zhanwei Wang, Mingyao Cui +3On-Device Language Model InferenceEdge Computing