Deep Learning Optimization

Latest papers 134

All topics
CardsList
  1. Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks

    Jul 5, 2026Shokhrukh Ibragimov, Arnulf JentzenDeep Learning OptimizationNeural Network Optimization

  2. OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

    Jul 4, 2026Siyuan Li, Jiabao Pan, Yumou Liu +9Deep Learning OptimizationNeural Network Optimization

  3. Class-Grouped Normalized Momentum and Faster Hyperparameter Exploration to Tackle Class Imbalance in Federated Learning

    Jul 1, 2026Haemin Park, Diego Klabjan, Martin W. Braun +2Class-Imbalanced LearningDeep Learning Optimization

  4. Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

    Jun 29, 2026Haoming Meng, Anton Sugolov, Vardan PapyanDeep Learning OptimizationNeural Network Optimization

  5. Tensorion: A Tensor-Aware Generalization of the Muon Optimizer

    Jun 24, 2026Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko +2Deep Learning OptimizationMuon Optimizer

  6. An Analysis of Posterior Collapse, Parameterization and Initialization in Variational Deep Gaussian Processes

    Jun 24, 2026Francisco Javier Sáez-Maldonado, Juan Maroñas, Daniel Hernández-LobatoDeep Learning OptimizationPosterior Collapse

  7. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

    Jun 23, 2026Kwok Chun Au, Adam BlockDeep Learning OptimizationLLM Training

  8. Fast and Slow Variational Continual Learning

    Jun 22, 2026Subarnaduti Paul, Yohan Jung, Mohammad Emtiyaz Khan +3Continual Learning for LLMsDeep Learning Optimization

  9. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3Deep Learning OptimizationMuon Optimizer

  10. Breaking chains with trees: Deep learning with O(log⁡N)\mathcal{O}(\log N) parallel time complexity

    Jun 19, 2026Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam +4Deep Learning OptimizationNeural Network Optimization

  11. Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study

    Jun 18, 2026Anton Abramochkin, Radu Timofte, Dmitry IgnatovDeep Learning OptimizationNeural Network Optimization

  12. eCNNTO: A Highly Generalizable ConvNet for Accelerating Topology Optimization

    Jun 18, 2026Shengbiao Lu, Xiaodong WeiTopology OptimizationDeep Learning Optimization

  13. Schattor: Schatten-family methods for deep learning optimization

    Jun 14, 2026Bohao Ma, Junyu Zhang, Chuan HeDeep Learning OptimizationStochastic Optimization Convergence

  14. Beyond a Single Explanation of the Adam--SGD Gap

    Jun 12, 2026Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni +3Deep Learning OptimizationAdaptive Gradient Methods

  15. Gefen: Optimized Stochastic Optimizer

    Jun 11, 2026Nadav Benedek, Tomer Koren, Ohad FriedDeep Learning OptimizationMemory-Efficient Optimization

  16. LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

    Jun 11, 2026Franz Louis Cesista, Katherine Crowson, Cédric Simal +1Deep Learning OptimizationRiemannian Optimization

  17. 5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

    Jun 9, 2026Yifan Zhu, Can Lin, Hangjie Yuan +4Deep Learning OptimizationFlat Minima

  18. FOGO: Forgetting-aware Orthogonalization Optimizer

    Jun 9, 2026Toan Nguyen, Yang Liu, Trung Le +2Deep Learning OptimizationContinual Learning

  19. Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory

    Jun 4, 2026Sam Buchanan, Druv Pai, Peng Wang +1Deep Learning OptimizationRepresentation Learning

  20. Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss

    Jun 4, 2026Thomas T. Zhang, Alok Shah, Yifei Zhang +3Deep Learning Optimization

  21. Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

    Jun 2, 2026Xianliang Li, Zihan Zhang, Weiyang Liu +1Deep Learning OptimizationMomentum Methods

  22. Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks

    May 29, 2026Tianyu Pang, Vignesh Kothapalli, Shenyang Deng +3Deep Learning OptimizationNeural Network Training Dynamics

  23. Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling

    May 29, 2026Dmitrii Feoktistov, Timofey Belinsky, Andrey Veprikov +2Stochastic OptimizationSign-Based Optimization