Fault-Tolerant Distributed Training

Latest papers 16

All topics
CardsList
  1. Leto: Fast In-Place Recovery for LLM Training on Surviving Hardware

    Sep 30, 2026Geon-Woo Kim, Joon Ha Kim, Daehyeok KimFault-Tolerant Distributed TrainingLLM Training

  2. Robustifying Asynchronous SGD via Soft Throttling

    Sep 30, 2026Kaoru Otsuka, Maxime Meyer, Yuki Takezawa +2Distributed OptimizationFault-Tolerant Distributed Training

  3. PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint

    Jul 2, 2026Haotian Xie, Junlin Chen, Mingkai Zheng +2Fault-Tolerant Distributed TrainingDistributed Training

  4. Factored Gossip DiLoCo: Reducing Blocking Communication in DiLoCo

    Jun 22, 2026Chamin Hewa Koneputugodage, Thalaiyasingam Ajanthan, Sameera Ramasinghe +7Communication-Efficient Distributed TrainingDistributed Optimization

  5. Don't Let a Few Network Failures Slow the Entire AllReduce

    Jun 1, 2026Peiqing Chen, Jiedong Jiang, Nengneng Yu +4Communication-Efficient Distributed TrainingHigh-Performance Computing

  6. TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training

    May 18, 2026Shujie Han, Feng Jiang, Patrick P. C. Lee +5Fault-Tolerant Distributed TrainingDistributed Training

  7. ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

    May 11, 2026Ziyue Liu, Zhengyang Wang, Ruijie Zhang +7Language Model PretrainingFault-Tolerant Distributed Training

  8. BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

    May 11, 2026Ting Sun, Junjie Zhang, Xiao Yan +7Fault-Tolerant Distributed TrainingDistributed Training

  9. Decoupled DiLoCo for Resilient Distributed Pre-training

    Apr 23, 2026Arthur Douillard, Keith Rush, Yani Donchev +14Language Model PretrainingDistributed Optimization

  10. Tight Stability Bounds for Robust Distributed Learning: Byzantine Failures Hurt Generalization More than Data Poisoning

    Jun 22, 2025Thomas Boudou, Batiste Le Bars, Nirupam Gupta +1Byzantine-Robust Federated LearningAlgorithmic Stability