Neural Network Training Dynamics

Latest papers 349

All topics
CardsList
  1. Backpropagation-Free Trunk Training via the Split Forward Gradients

    Jul 18, 2026Tian Qin, Wei-Min HuangBackpropagationGradient Descent

  2. Certifying Residual Architectures from Their Primitives: A Sharp Stability Threshold

    Jul 16, 2026Hyemin Gu, Michael Tyrrell, Tuhin Sahai +1Neural Network VerificationResidual Learning

  3. How the Hessian-Spectrum of Neural Networks Depends on Data

    Jul 15, 2026Jasraj Singh, Enea Monzio Compagnoni, Antonio OrvietoNeural Network OptimizationDeep Linear Networks

  4. Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks

    Jul 13, 2026Tiberiu Musat, Tiago Pimentel, Nicolas Zucchet +1In-Context LearningCircuits in Language Models

  5. Backpropagation as a Nilpotent Linear System

    Jul 13, 2026Ahmed BoughammouraBackpropagationNeural Network Training Dynamics

  6. Infrared Organization and Critical Cognitive Field Formation in Transformer Dynamics

    Jul 12, 2026Byung Gyu ChaeTransformerNeural Network Training Dynamics

  7. Singular perturbations and hierarchical learning in two-layer neural networks

    Jul 12, 2026Cédric Gerbelot, Jean-Christophe MourratMultilayer PerceptronsNeural Network Training Dynamics

  8. LayerNorm as Implicit Gain Control in Looped Transformers

    Jul 12, 2026Matthias M. M. BuehlmaierRecurrent TransformersLayer Normalization

  9. Interpreting learning dynamics of autoencoders: Transient scaling and emerging concepts of the Ising model

    Jul 11, 2026Max Weinmann, Miriam KlopotekAutoencodersUnsupervised Representation Learning

  10. The Differential Neural Tangent Kernel and Its Positivity

    Jul 11, 2026Bangti Jin, Longjun WuNeural PDE SolversPhysics-Informed ML

  11. How are linear representations learned? Exact solutions to the dynamics of abstraction

    Jul 9, 2026William W. Yang, Andrew M. Saxe, Peter E. LathamLinear Representation HypothesisDeep Linear Networks

  12. The Silent Freeze: Predicting When Low-Precision Training Stops Learning

    Jul 9, 2026Zekai ShangNeural Network Training DynamicsLow-Bit Quantization

  13. The Anatomy of Implicit Bias: Information Allocation in Neural Network Training

    Jul 8, 2026Zhang Gongyue, Wang Zhiyong, Liu Donghan +3Neural Network OptimizationImplicit Bias

  14. On the Principles of Deep Feedforward ReLU Networks

    Jul 8, 2026Changcun HuangReLU Neural NetworksNeural Network Interpretability

  15. Broken Ergodicity and the Violation of the Fluctuation-Dissipation Theorem Lead to Generalization Beyond Overfitting in Machine Learning

    Jul 5, 2026Chan Li, Nigel GoldenfeldDouble DescentStatistical Physics of Learning

  16. Implicit Bias of SGD in Multivariate ReLU Networks: Effective Width Collapse

    Jul 3, 2026Shuang Liang, Tom Jacobs, Guido MontúfarShallow Neural NetworksReLU Neural Networks

  17. Muon as a Residual Connection

    Jul 1, 2026Hao HuangNeural Network OptimizationMuon Optimizer

  18. SGD at the Edge of Stability: Stochastic Stabilization with Large Learning Rates

    Jun 29, 2026Konstantinos Emmanouilidis, Lachlan MacDonald, Salma Tarmoun +1Edge of StabilityStochastic Optimization Convergence

  19. Predictable GRPO: A Closed-Form Model of Training Dynamics

    Jun 29, 2026Rajat Ghosh, Datta Nimmaturi, Aryan Singhal +4Group Relative Policy OptimizationPolicy Optimization

  20. SGD Provably Prioritizes a Shortcut Spurious Feature in the XOR Model

    Jun 29, 2026Tyler LaBonte, Vidya MuthukumarRepresentation LearningReLU Neural Networks

  21. Scalar Representations of Neural Network Training Dynamics

    Jun 29, 2026Pedro Jiménez-González, Miguel C. Soriano, Lucas LacasaNeural Network OptimizationChaotic Dynamical Systems

  22. Characterizing Optimizer-Dependent Training Dynamics Through Hessian Eigenvector Displacement and Localization

    Jun 29, 2026Marcelina Marjankowska, Valerio Modugno, Paolo BaruccaSpectral MethodsAdaptive Gradient Methods

  23. What Drives the Inlier-Memorization Effect? A Theory of Outlier Detection via Early Training Dynamics

    Jun 29, 2026Kunwoong Kim, Dongha KimUnsupervised Anomaly DetectionNeural Network Training Dynamics

  24. Learning as Observable Matrix Dynamics: Diffusive Relaxations versus Phase Transitions

    Jun 29, 2026Igor HalperinNeural Representation GeometryNeural Network Training Dynamics