Distributed Training

Latest papers 82

All topics
CardsList
  1. TL++: Accuracy and Privacy Preserving Traversal Learning for Distributed Intelligent Systems

    Jun 24, 2026Erdenebileg Batbaatar, Young YoonCommunication-Efficient Distributed TrainingPrivacy-Preserving ML

  2. Factored Gossip DiLoCo: Reducing Blocking Communication in DiLoCo

    Jun 22, 2026Chamin Hewa Koneputugodage, Thalaiyasingam Ajanthan, Sameera Ramasinghe +7Communication-Efficient Distributed TrainingDistributed Optimization

  3. FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs

    Jun 17, 2026Lorenzo Sani, Zeyu Cao, Meghdad Kurmanji +5Expert ParallelismCommunication-Efficient Distributed Training

  4. Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training

    Jun 15, 2026Sameera Ramasinghe, Ajanthan Thalaiyasingam, Hadi Mohaghegh Dolatabadi +5Communication-Efficient Distributed TrainingLong-Context Language Modeling

  5. Clipping Makes Distributed and Federated Asynchronous SGD Robust to Stragglers

    Jun 11, 2026Samuel Erickson, Mikael JohanssonGradient ClippingStochastic Optimization Convergence

  6. Piper: A Programmable Distributed Training System

    Jun 9, 2026Megan Frisella, Shubham Tiwari, Andy Ruan +5Distributed OptimizationDistributed Training

  7. ASTRA-sim 3.0: Next-Level Distributed Machine Learning Simulations via High-Fidelity GPU and Infrastructure Modeling

    Jun 9, 2026William Won, Jinsun Yoo, Tuan Ta +16Distributed Training

  8. Resource-aware Computation-Communication Overlap for multi-GPU ML Workloads

    Jun 8, 2026Minyu Cui, Miquel PericasGPU Kernel OptimizationCommunication-Efficient Distributed Training

  9. UltraEP: Unleash MoE Training and Inference on Rack-Scale Nodes with Near-Optimal Load Balancing

    Jun 2, 2026Xinming Wei, Chao Jin, Tuo Dai +10Expert ParallelismExpert Load Balancing

  10. Don't Let a Few Network Failures Slow the Entire AllReduce

    Jun 1, 2026Peiqing Chen, Jiedong Jiang, Nengneng Yu +4Communication-Efficient Distributed TrainingHigh-Performance Computing

  11. Does Distributed Training Undermine Compute Governance?

    May 28, 2026Robi RahmanDistributed TrainingAI Governance

  12. High-speed Networking for Giga-Scale AI Factories

    May 20, 2026Sajy Khashab, Albert Gran Alcoz, Alon Gal +11Distributed Training

  13. Guard: Scalable Straggler Detection and Node Health Management for Large-Scale Training

    May 18, 2026Guanliang Liu, Abhinandan Patni, Congzhu Lin +14Distributed TrainingAnomaly Detection

  14. TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training

    May 18, 2026Shujie Han, Feng Jiang, Patrick P. C. Lee +5Fault-Tolerant Distributed TrainingDistributed Training

  15. A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM

    May 15, 2026Shaoke Xi, ChonLam Lao, Boyi Jia +11High-Performance ComputingDistributed Training

  16. Byzantine-Robust Distributed Sparse Learning Revisited

    May 13, 2026Yuxuan Wang, Lixin Zhang, Kangqiang LiRobust RegressionDistributed Optimization

  17. DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training

    May 12, 2026Yuanqing Wang, Yuchen Zhang, Hao Lin +9Efficient Language Model TrainingDistributed Training

  18. MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces

    May 11, 2026Srinivas Sridharan, Theodor-Adrian Badea, Andy Balogh +26Benchmark DesignHardware-Software Co-Design

  19. ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

    May 11, 2026Ziyue Liu, Zhengyang Wang, Ruijie Zhang +7Language Model PretrainingFault-Tolerant Distributed Training

  20. ShardTensor: Domain Parallelism for Scientific Machine Learning

    May 11, 2026Corey Adams, Peter Harrington, Akshay Subramaniam +4Scientific MLDistributed Training

  21. BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

    May 11, 2026Ting Sun, Junjie Zhang, Xiao Yan +7Fault-Tolerant Distributed TrainingDistributed Training

  22. DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism

    May 10, 2026Zhichen Zeng, Chi-Chih Chang, Jiayi Wang +10Expert ParallelismCommunication-Efficient Distributed Training