Neural Network Training Dynamics

Latest papers 349

All topics
CardsList
  1. Advancing Direct Training for Spiking Neural Networks with Circulate-Firing Neurons and Learnable Gradients

    May 14, 2026Feifan Zhou, Xiang Wei, Yang Liu +1Spiking Neural NetworksNeural Network Training Dynamics

  2. Dynamics of the Transformer Residual Stream: Coupling Spectral Geometry to Network Topology

    May 14, 2026Jesseba Fernando, Grigori GuitchountsDynamical SystemsTransformer

  3. Deep Learning as Neural Low-Degree Filtering: A Spectral Theory of Hierarchical Feature Learning

    May 13, 2026Yatin Dandi, Matteo Vilucchio, Luca Arnaboldi +2Hierarchical Representation LearningNeural Network Training Dynamics

  4. First-Passage Prediction of Grokking Delay: ACalibrated Law under AdamW with Causal Validation

    May 13, 2026Truong Xuan Khanh, Truong Quynh Hoa, Luu Duc Trung +1Neural Network MemorizationNeural Network Training Dynamics

  5. State-Space NTK Collapse Near Bifurcations

    May 12, 2026James Hazelden, Eric Shea-BrownRecurrent Neural NetworksNeural Network Training Dynamics

  6. Detecting overfitting in Neural Networks during long-horizon grokking using Random Matrix Theory

    May 12, 2026Hari K. Prakash, Charles H MartinNeural Network GeneralizationNeural Network Training Dynamics

  7. Understanding Sample Efficiency in Predictive Coding

    May 12, 2026Gaspard Oliviers, Elene Lominadze, Rafal BogaczBackpropagationPredictive Coding

  8. OUI as a Structural Observable: Towards an Activation-Centric View of Neural Network Training

    May 12, 2026Alberto Fernández-Hernández, Jose I. Mestre, Cristian Pérez-Corral +3Neural Network GeneralizationNeural Network Training Dynamics

  9. Error whitening: Why Gauss-Newton outperforms Newton

    May 11, 2026Maricela Best McKay, Nathan P. Lawrence, Brian Wetton +1Gauss-Newton OptimizationDeep Learning Optimization

  10. Uniform Scaling Limits in AdamW-Trained Transformers

    May 11, 2026William Gibson, Christoph ReisingerTransformerSelf-Attention

  11. On the global convergence of gradient descent for wide shallow models with bounded nonlinearities

    May 11, 2026Romain Petit, Clarice Poon, Gabriel PeyréShallow Neural NetworksGradient Descent

  12. Simply Stabilizing the Loop via Fully Looped Transformer

    May 11, 2026Rao Fu, Zixuan Yang, Jiankun Zhang +4Test-Time ScalingRecurrent Transformers

  13. The two clocks and the innovation window: When and how generative models learn rules

    May 11, 2026Binxu Wang, Emma Lucia Byrnes Finn, Bingbin LiuMemorization in Generative ModelsGenerative Modeling

  14. Flag Varieties: A Geometric Framework for Deep Network Alignment

    May 11, 2026Jingchuan Xiao, Xinyi Sui, Cihan RuanNeural Representation GeometryNeural Collapse

  15. Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective

    May 9, 2026Jiuqi Wang, Jayanth Srinivasa, Claire Chen +3Deep Learning OptimizationLoss of Plasticity

  16. Spherical Boltzmann machines: a solvable theory of learning and generation in energy-based models

    May 9, 2026Thomas Tulinski, Simona Cocco, Rémi Monasson +1Statistical Physics of LearningPhase Transitions

  17. Convergence Analysis of Newton's Method for Neural Networks in the Overparameterized Limit

    May 8, 2026Konstantin Riedl, Konstantinos Spiliopoulos, Justin SirignanoNeural Network OptimizationSpectral Bias

  18. Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer

    May 8, 2026Clarissa Lauditi, Cengiz Pehlevan, Blake BordelonDeep Linear NetworksNeural Network Training Dynamics

  19. Training-Induced Escape from Token Clustering in a Mean-Field Formulation of Transformers

    May 8, 2026Noboru Isobe, Daisuke Inoue, Masaaki ImaizumiTransformerClustering

  20. Bilevel Graph Structure Learning, Revisited: Inner-Channel Origins of the Reported Gain

    May 8, 2026Minkyoung Kim, Beakcheol JangGraph Structure LearningGraph Neural Networks

  21. On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

    May 7, 2026Hao Ye, Jisheng Dang, Junfeng Fang +7Reinforcement LearningReinforcement Learning with Verifiable Rewards

  22. Region Seeding via Pre-Activation Regularization: A Geometric View of Piecewise Affine Neural Networks

    May 7, 2026Yi Wei, Xuan Qi, Furao ShenNeural Network Activation FunctionsNeural Network Approximation Theory

  23. The Weight Gram Matrix Captures Sequential Feature Linearization in Deep Networks

    May 7, 2026Taehun Cha, Daniel Beaglehole, Adityanarayanan Radhakrishnan +1Neural Network Training DynamicsGradient Descent Dynamics

  24. Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes

    May 7, 2026Hanqing Liu, Jianjun Cao, Yuanze Li +1Neural Network Training Dynamics

  25. Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training

    May 7, 2026Hang Chen, Jiaying Zhu, Hongyang Chen +3Supervised Fine-TuningTransformer Interpretability