Distributed Training

Latest papers 82

All topics
CardsList
  1. HAPMoE: Heterogeneity-Aware Automatic Parallelism Planning for Mixture-of-Experts Models Training

    Sep 30, 2026Mengyuan Fan, Peizhuang Cong, Zixiao Huang +7Expert ParallelismHeterogeneous Computing

  2. AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

    Sep 29, 2026Pengyu He, Yan Zhang, Ruien Li +1Communication-Efficient Distributed TrainingDistributed Training

  3. TopoEP: Topology-Aware Load Balancing for Expert-Parallel MoE Training

    Sep 28, 2026Jiacheng Zhu, Xie Zhao, Gongming Zhao +3Expert ParallelismExpert Load Balancing

  4. FairMean: Promoting Fairness in Distributed Learning under Label Poisoning Attacks

    Sep 22, 2026Huigan Zheng, Jiaojiao Zhang, Yongxiang LiuAlgorithmic FairnessAdaptive Loss Weighting

  5. Efficiently Distributed Federated Learning

    Sep 17, 2026Gianluca Mittone, Robert Birke, Marco AldinucciDistributed TrainingFederated Learning

  6. OPEN-1B: A Fully Auditable Training Run

    Sep 15, 2026John Donaghy, Brian Wilcox, Oğuzhan Ersoy +6Neural Network VerificationLLM Auditing

  7. LLM-Based Schema-Aware Split Learning for Privacy-Preserving Mental Distress Prediction Across Heterogeneous Surveys

    Sep 14, 2026Md Khalid Syfullah, Alvi Ataur KhalilPrivacy-Preserving MLClinical Prediction

  8. 4D Parallelism Unlocks Exascale Bayesian Neural Networks for High-Fidelity Atmospheric Modeling

    Sep 14, 2026Deifilia Kieckhefen, Juan Pedro Gutiérrez Hermosillo Muriedas, Lars Helge Heyen +12Bayesian Neural NetworksUncertainty Quantification

  9. Generalization Analysis of Distributed Kernel-based Robust Gradient Descent Algorithms

    Sep 10, 2026Jun-Yi Meng, Zheng-Chu Guo, Yuan MaoKernel RegressionCommunication-Efficient Distributed Training

  10. Scalability Analysis of Distributed Kolmogorov-Arnold Network Training on High-Performance Computing Systems

    Sep 7, 2026Guangneng Chen, David Garcia Selfa, Pablo Quesada BarriusoHigh-Performance ComputingKolmogorov-Arnold Networks

  11. Contribution-Aware Bandwidth Allocation for Multimodal Split Learning

    Sep 1, 2026Iason Ofeidis, Leandros TassiulasDistributed TrainingMultimodal Learning

  12. SatDL: Jointly Optimizing Data Redistribution and Training for Satellite-Based Distributed Learning

    Aug 25, 2026Hao Wu, Kin Whye Chew, Yizhan Han +2Distributed Training

  13. SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization

    Aug 10, 2026Gyudong Kim, Wonjun Han, Young Geun KimGPU Kernel OptimizationTensor Parallelism

  14. LGNNIC: Acceleration of Large-Scale GNN Training using SmartNICs

    Aug 7, 2026Liad Gerstman, Aditya Dhakal, Dejan Milojicic +1Graph Neural NetworksCommunication-Efficient Distributed Training

  15. Stream Learning: Partition-Fair Gossip Learning Without Tokens

    Aug 7, 2026Fabien Mathieu, Alexandre Pham, Maria Gradinariu Potop-Butucaru +1Communication-Efficient Distributed TrainingDecentralized Learning

  16. ML-for-ML

    Aug 6, 2026Yutong Zhao, Noga H. Rotman, Gianni Antichi +1Communication-Efficient Distributed TrainingDistributed Training

  17. Empowering Credit Risk Detection in Weixin Pay with Billion-Scale Deep Graph Learning

    Aug 3, 2026Xin Liu, Xiyuan Chen, Chenglong Wu +3AI Risk ManagementFinancial Fraud Detection

  18. Using Non-Lipschitz Signum-based Functions for Distributed Optimization and Machine Learning: Trade-off Between Con-vergence Rate and Optimality Gap

    Aug 2, 2026Mohammadreza Doostmohammadian, Amir Ahmad Ghods, Alireza Aghasi +2Sign-Based OptimizationDistributed Optimization

  19. Pipelined Gradient Coding

    Jul 22, 2026Xian Su, Jun LiDistributed Training

  20. The Power of Backdoor Absorption in Community Training

    Jul 7, 2026Issam Seddik, Sami Souihi, Mohamed Tamaazousti +1Algorithmic AuditingBackdoor Attacks

  21. PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint

    Jul 2, 2026Haotian Xie, Junlin Chen, Mingkai Zheng +2Fault-Tolerant Distributed TrainingDistributed Training

  22. Unveiling the Non-Monotonic Effect of Privacy on Generalization under Byzantine Robustness

    Jul 1, 2026Thomas Boudou, Batiste Le Bars, Nirupam Gupta +1Differential PrivacyDistributed Training

  23. MALOQ: Massively Accelerated Learning of Operators for Quantum Transport

    Jun 27, 2026Manasa Kaniselvan, Alexander Maeder, Denghui Lu +2Quantum ChemistryHigh-Performance Computing

  24. Optimizing Teacher-Student Partitioning for Scalable Knowledge Distillation on HPC Systems

    Jun 26, 2026Adrian P. Dieguez, Victor Conchello Vendrell, Alex Batlle +3High-Performance ComputingDistributed Training