Neural Network Training Dynamics

Latest papers 349

All topics
CardsList
  1. Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks

    May 29, 2026Tianyu Pang, Vignesh Kothapalli, Shenyang Deng +3Deep Learning OptimizationNeural Network Training Dynamics

  2. Dynamics and Representation Structure of Local Approximations to Gradient-Based Learning in Linear Recurrent Neural Networks

    May 29, 2026Ezekiel Williams, Alexandre Payeur, Guillaume LajoieRecurrent Neural NetworksLinear RNNs

  3. Gradient Descent with Large Step Size Restores Symmetry in Deep Linear Networks with Multi-Pathway

    May 29, 2026Hee-Sung Kim, Sungyoon LeeEdge of StabilitySymmetry Breaking

  4. Spectral Reach: Understanding Neural Scaling as Progress into the Spectral Tail

    May 29, 2026Konstantin Nikolaou, Jonas Scheunemann, Sven Krippendorf +2Representation LearningNeural Network Training Dynamics

  5. A2SG:Adaptive and Asymmetric Surrogate Gradients for Training Deep Spiking Neural Networks

    May 29, 2026Yechan Kang, Yongjin Kweon, Mingyeong Seo +8Neural Network OptimizationSpiking Neural Networks

  6. Augmented Lagrangian Predictive Coding

    May 29, 2026Jeffrey Seely, Julian GouldBackpropagationPredictive Coding

  7. Interpreting FCDNNs via RG on Exponential Family

    May 29, 2026Fuzhou Gong, Zigeng XiaNeural Network InterpretabilityNeural Network Training Dynamics

  8. Unveiling Multi-regime Patterns in SciML: Distinct Failure Modes and Regime-specific Optimization

    May 27, 2026Yuxin Wang, Yuanzhe Hu, Xiaokun Zhong +7Neural Network OptimizationScientific ML

  9. Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias

    May 27, 2026Mohua Das, Pierfrancesco Beneventano, Shibshankar Dey +2Neural Network GeneralizationNeural Network Initialization

  10. The Hamilton-Jacobi Theory of Deep Learning

    May 27, 2026Jose Marie Antonio Miñoza, Erika Fille T. Legara, Christopher P. MonterolaNeural Network GeneralizationNeural Network Training Dynamics

  11. Gradient-Flow Optimization as Dynamic Random-Effects Inference: Testing and Early Stopping with Applications to Deep Learning

    May 27, 2026Minhao Yao, Ruoyu Wang, Xihong Lin +2Early StoppingNeural Network Training Dynamics

  12. Worker Disagreement Reveals Sharp Directions in Local SGD

    May 26, 2026Tolga Dimlioglu, Kristi Topollai, Anna ChoromanskaNeural Network Training DynamicsLoss Landscape Geometry

  13. How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks

    May 26, 2026Teodor-Mihai Stupariu, Andrei ManolacheNeural Representation GeometryNeural Network Optimization

  14. SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training

    May 26, 2026Mohammed Adnan, Rohan Jain, Tom Jacobs +4Neural Network OptimizationNeural Network Training Dynamics

  15. Mildly Overparameterized ReLU Networks on Orthogonal Data: Incremental Learning and Implicit Bias

    May 26, 2026James Town, Etienne Boursier, Ben Lewis +2ReLU Neural NetworksNeural Network Optimization

  16. Two Speeds of Learning: A Representation-Readout Decomposition of Grokking and Double Descent

    May 26, 2026Chi-Ning Chou, Oscar Uzdelewicz, Neng-Chun Chiu +2Double DescentNeural Network Generalization

  17. Architecture-driven Shift: towards a lightweight selector for capturing the trends of logit shift

    May 26, 2026Zhong Ye, Yu Hu, Ruilin TangContinual LearningNeural Network Training Dynamics

  18. The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

    May 26, 2026Hongtao Zhang, Wenjie Zhou, Chenxi Jia +2Language Model PretrainingDeep Learning Optimization

  19. Stochastic Estimation of the Layer-wise Hessian Trace for Monitoring Neural-network Training

    May 25, 2026Maxim Bolshim, Alexander KugaevskikhNeural Network MemorizationStochastic Approximation

  20. Towards the Connection between Activation Sparsity and Flat Minima

    May 25, 2026Ze Peng, Jian Zhang, Lei Qi +2Efficient Neural Network InferenceActivation Sparsity

  21. Mitigating Gradient Pathology in PINNs through Aligned Constraint

    May 24, 2026Yichen Luo, Peiyu Zhu, Dongxiao Hu +5Neural PDE SolversGradient Interference

  22. On the Impact of Class Imbalance on the Learning Dynamics of Deep Neural Networks:An Intuitive Insight

    May 24, 2026Ismail B. Mustapha, Shafaatunnur Hasan, Sunday O. Olatunji +1Class-Imbalanced LearningNeural Network Generalization

  23. A lift for input-convex neural net training

    May 22, 2026Ali SiahkoohiNeural Network OptimizationInput Convex Neural Networks

  24. Move on Muon : A Hamiltonian probability gradient flow perspective of Muon optimizer

    May 22, 2026Aratrika Mustafi, Soumya Mukherjee, Bharath K. SriperumbudurMomentum MethodsMuon Optimizer

  25. Not All Transitions Matter: Evidence from PPO

    May 22, 2026Ajhesh BasnetProximal Policy OptimizationNeural Network Training Dynamics

  26. Non-normal spectral signatures of instability in neural network training dynamics

    May 22, 2026Souvik GhoshDynamical SystemsNeural Network Optimization