Neural Network Training Dynamics

Latest papers 349

All topics
CardsList
  1. A Mechanism Study of Delayed Loss Spikes in Batch-Normalized Linear Models

    Apr 18, 2026Peifeng Gao, Wenyi Fang, Yang Zheng +1Neural Network OptimizationNeural Network Training Dynamics

  2. Curvature-Aligned Probing for Local Loss-Landscape Stabilization

    Apr 16, 2026Nikita Kiselev, Andrey GrabovoyNeural Network OptimizationNeural Network Training Dynamics

  3. Zeroth-Order Optimization at the Edge of Stability

    Apr 16, 2026Minhak Song, Liang Zhang, Bingcong Li +3Edge of StabilityZeroth-Order Optimization

  4. VISTA: Validation-Informed Trajectory Adaptation via Self-Distillation

    Apr 13, 2026Eli Corn, Daphna WeinshallNeural Network GeneralizationDeep Learning Optimization

  5. To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters

    Feb 28, 2026Sara Dragutinović, Yedi Zhang, Rajesh RanganathNeural Network GeneralizationMuon Optimizer

  6. Don't stop me now: How Validation Criteria Affect Checkpoint Selection and Early Stopping

    Feb 25, 2026Andrea Apicella, Francesco Isgrò, Andrea Pollastro +1Early StoppingNeural Network Training Dynamics

  7. Incremental Learning of Sparse Attention Patterns in Transformers

    Feb 22, 2026Oğuz Kaan Yüksel, Rodrigo Alvarez Lucendo, Nicolas FlammarionSelf-AttentionTransformer Attention

  8. On the Emergence of Implicit Curriculum in RLVR Learning Dynamics

    Feb 16, 2026Yu Huang, Zixin Wen, Yuejie Chi +4RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  9. ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling

    Feb 9, 2026Yilang Zhang, Bingcong Li, Niao He +1Residual LearningNeural Network Optimization

  10. Adaptive Momentum and Nonlinear Damping for Neural Network Training

    Jan 30, 2026Aikaterini Karoni, Rajit Rajpal, Benedict Leimkuhler +1Momentum MethodsStochastic Optimization Convergence

  11. Why β1=β2β_1 = β_2 Is Dynamically Special in Adam

    Jan 29, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2Momentum MethodsAdaptive Gradient Methods

  12. Linearized subspace refinement framework to expose hidden accuracy in trained neural networks

    Jan 20, 2026Wenbo Cao, Weiwei ZhangNeural Network OptimizationNeural Network Approximation Theory

  13. Understanding and inverse design of implicit bias in stochastic learning: a geometric perspective

    Jan 10, 2026Nicola Aladrah, Emanuele Ballarin, Matteo Biagetti +3Implicit BiasNeural Network Training Dynamics

  14. Deep Neural Networks as Discrete Dynamical Systems: Implications for Physics-Informed Learning

    Jan 1, 2026Abhisek Ganguly, Santosh Ansumali, Sauro SucciDynamical SystemsNeural PDE Solvers

  15. Quantitative Understanding of PDF Fits and their Uncertainties

    Dec 30, 2025Amedeo Chiefa, Luigi Del Debbio, Richard KenwayUncertainty QuantificationHigh-Energy Physics

  16. Dropout Neural Network Training Viewed from a Percolation Perspective

    Dec 15, 2025Finley Devlin, Jaron SandersNeural Network Training Dynamics

  17. Random matrix theory of sparse neuronal networks with heterogeneous timescales

    Dec 14, 2025Thiparat Chotibut, Oleg Evnin, Weerawit HorinouchiRandom Matrix TheoryRecurrent Neural Networks

  18. Mean-Field Model for Two-Layer Neural Networks Trained with Consensus-Based Optimization

    Nov 26, 2025William De Deyn, Michael Herty, Giovanni SamaeyNeural Network OptimizationMean-Field Theory

  19. Understanding the Staged Dynamics of Transformers in Learning Latent Structure

    Nov 24, 2025Rohan Saha, Farzane Aminmansour, Alona FysheDecoder-Only Language ModelsNeural Network Training Dynamics

  20. Fast Generalized Neural Tangent Kernel Statistics via Trace Estimation

    Nov 13, 2025James Hazelden, Balaaji Reddy Nagireddy, Eric Shea-BrownNeural Network Training DynamicsNeural Tangent Kernel

  21. Can Stationary Distributions of Scale-Invariant Neural Networks Be Described by the Thermodynamics of an Ideal Gas?

    Nov 10, 2025Ildus Sadrtdinov, Ekaterina Lobacheva, Ivan Klimov +3Statistical Physics of LearningNeural Network Training Dynamics

  22. Why Do We Need Warm-up? A Theoretical Perspective

    Oct 3, 2025Foivos Alimisis, Rustem Islamov, Aurelien LucchiDeep Learning OptimizationLearning Rate Scheduling

  23. Quantifying How Training Gradient Sparsity Affect Spiking Neural Network Accuracy And Robustness

    Sep 28, 2025Nhan Trong Luu, Duong Trung LuuNeural Network GeneralizationNeural Network Robustness

  24. Uncertain but Useful: Leveraging CNN Training Variability into Data Augmentation

    Sep 5, 2025Inés Gonzalez-Pepe, Vinuyan Sivakolunthu, Yohan Chatelain +1Image SegmentationData Augmentation