Neural Network Training Dynamics

Latest papers 349

All topics
CardsList
  1. The Weight Norm Sets the Grokking Timescale: A Causal Delay Law

    Jun 11, 2026Truong Xuan Khanh, Doan Hoang Viet, Luu Duc Trung +1Neural Network GeneralizationNeural Network Training Dynamics

  2. Phase Transitions in Attention: A Bayesian Theory of Copy Head Emergence

    Jun 10, 2026Itay Lavie, Kirsten Fischer, Andrey Lekov +3Softmax AttentionPhase Transitions

  3. Overcoming Rank Collapse in Feedback Alignment

    Jun 9, 2026Gauthier Boeshertz, Razvan Pascanu, Claudia ClopathBackpropagationNeural Network Optimization

  4. Conservation Laws from Data Symmetry in Neural Networks

    Jun 9, 2026Jakob Galley, Vahid Shahverdi, Axel FlinthNeural Network OptimizationNeural Network Training Dynamics

  5. Towards Critical Branching Mechanism in Recurrent Neural Networks

    Jun 9, 2026Feixiang Ren, Ling FengRecurrent Neural NetworksLong Short-Term Memory Networks

  6. Rank Collapse, Fixed Points, and the Renormalization Group Structure of MLP Residual Networks

    Jun 9, 2026Parviz Haggi-Mani, Irina RishMultilayer PerceptronsNeural Network Training Dynamics

  7. Learning Entropy and Spatial Adaptation Dynamics of Multilayer Perceptrons for Structural Point Extraction

    Jun 8, 2026Jan Glaser, Ivo Bukovsky, Marcel JirinaMultilayer PerceptronsNeural Network Training Dynamics

  8. Preserving Plasticity in Continual Learning via Dynamical Isometry

    Jun 8, 2026Andries Rosseau, Robert Müller, Ann NowéLoss of PlasticityContinual Learning

  9. Integrating Out, Twice:The Open-System Case That Neural-Network Ensemble Theory Is Missing

    Jun 8, 2026Jin LeiEnsemble LearningNeural Network Training Dynamics

  10. Hybridizing Equilibrium Propagation with Ising Machines for Efficient Energy-Based Learning

    Jun 8, 2026Chen-Rui Fan, Bo Lu, Xing-Yu Wu +2Equilibrium PropagationHopfield Networks

  11. Beyond Neural Collapse: Task-Intrinsic Geometry Governs Neural Representations in Modular Arithmetic

    Jun 8, 2026Hu Tan, Kuo Gai, Shihua ZhangNeural Representation GeometryClassification

  12. Fourier fractal dimension to predict the generalization of deep neural networks

    Jun 6, 2026Joao B. Florindo, Davi Wanderley MisturiniNeural Network GeneralizationNeural Network Training Dynamics

  13. Breaking the Bubble: Asynchronous Pipeline Parallel Training with Bounded Weight Inconsistency

    Jun 5, 2026Itay Elam, Eliron Rahimi, Avi Mendelson +1Neural Network Training DynamicsPipeline Parallelism

  14. Second-Order Path Kernel Interpolation Formulas in Machine Learning

    Jun 5, 2026Jin Guo, Roy Y. He, Jean-Michel MorelNeural Network Training Dynamics

  15. Beyond Linear and Overcomplete Regimes: A Mean-Field Analysis of Bottleneck Autoencoders

    Jun 5, 2026Santanu Das, Ramyak Bilas, Pascal Esser +1AutoencodersMean-Field Theory

  16. Deciphering Two Training Clocks in Grokking via Deep Linear Network Theory with Conditional ReLU Reduction

    Jun 4, 2026Hu Tan, Kuo Gai, Shihua ZhangReLU Neural NetworksDeep Linear Networks

  17. A prism hierarchy of learning regimes in large linear autoencoders

    Jun 3, 2026Eugene Golikov, Yaroslav Gusev, Dmitry YarotskyAutoencodersNeural Network Training Dynamics

  18. Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics

    Jun 3, 2026Stella Biderman, Mohammad Aflah Khan, Niloofar Mireshghallah +3Neural Network Training Dynamics

  19. When Both Layers Learn: Training Dynamics of Representing Linear Models via ReLU Networks

    Jun 3, 2026Berk Tinaz, Changzhi Xie, Mahdi SoltanolkotabiReLU Neural NetworksNeural Network Optimization

  20. Spectral Scaling Laws of Muon

    Jun 2, 2026Gagik Magakyan, Pablo Parrilo, Asuman OzdaglarNewton-Schulz IterationMomentum Methods

  21. Neural Networks Provably Learn Spectral Representations for Group Composition

    Jun 2, 2026Jianliang He, Leda Wang, Fengzhuo Zhang +2Representation LearningNeural Network Training Dynamics

  22. Looped Transformers with Layer Normalization Provably Learn the Power Method

    May 30, 2026Lyumin Wu, Chenyang Zhang, Yuan CaoRecurrent TransformersLayer Normalization

  23. On the Difficulty of Learning a Meta-network for Training Data Selection

    May 30, 2026Zilin Du, Junqi Zhao, Boyang Albert LiMeta-LearningTraining Data Selection