Deep Learning Optimization

Latest papers 132

All topics
CardsList
  1. Class-Grouped Normalized Momentum and Faster Hyperparameter Exploration to Tackle Class Imbalance in Federated Learning

    Jul 1, 2026Haemin Park, Diego Klabjan, Martin W. Braun +2Class-Imbalanced LearningDeep Learning Optimization

  2. Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

    Jun 29, 2026Haoming Meng, Anton Sugolov, Vardan PapyanDeep Learning OptimizationNeural Network Optimization

  3. Tensorion: A Tensor-Aware Generalization of the Muon Optimizer

    Jun 24, 2026Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko +2Deep Learning OptimizationMuon Optimizer

  4. An Analysis of Posterior Collapse, Parameterization and Initialization in Variational Deep Gaussian Processes

    Jun 24, 2026Francisco Javier Sáez-Maldonado, Juan Maroñas, Daniel Hernández-LobatoDeep Learning OptimizationPosterior Collapse

  5. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

    Jun 23, 2026Kwok Chun Au, Adam BlockDeep Learning OptimizationLLM Training

  6. Fast and Slow Variational Continual Learning

    Jun 22, 2026Subarnaduti Paul, Yohan Jung, Mohammad Emtiyaz Khan +3Continual Learning for LLMsDeep Learning Optimization

  7. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3Deep Learning OptimizationMuon Optimizer

  8. Breaking chains with trees: Deep learning with O(log⁡N)\mathcal{O}(\log N) parallel time complexity

    Jun 19, 2026Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam +4Deep Learning OptimizationNeural Network Optimization

  9. Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study

    Jun 18, 2026Anton Abramochkin, Radu Timofte, Dmitry IgnatovDeep Learning OptimizationNeural Network Optimization

  10. eCNNTO: A Highly Generalizable ConvNet for Accelerating Topology Optimization

    Jun 18, 2026Shengbiao Lu, Xiaodong WeiTopology OptimizationDeep Learning Optimization

  11. Schattor: Schatten-family methods for deep learning optimization

    Jun 14, 2026Bohao Ma, Junyu Zhang, Chuan HeDeep Learning OptimizationStochastic Optimization Convergence

  12. Beyond a Single Explanation of the Adam--SGD Gap

    Jun 12, 2026Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni +3Deep Learning OptimizationAdaptive Gradient Methods

  13. Gefen: Optimized Stochastic Optimizer

    Jun 11, 2026Nadav Benedek, Tomer Koren, Ohad FriedDeep Learning OptimizationMemory-Efficient Optimization

  14. LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

    Jun 11, 2026Franz Louis Cesista, Katherine Crowson, Cédric Simal +1Deep Learning OptimizationRiemannian Optimization

  15. 5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

    Jun 9, 2026Yifan Zhu, Can Lin, Hangjie Yuan +4Deep Learning OptimizationFlat Minima

  16. FOGO: Forgetting-aware Orthogonalization Optimizer

    Jun 9, 2026Toan Nguyen, Yang Liu, Trung Le +2Deep Learning OptimizationContinual Learning

  17. Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory

    Jun 4, 2026Sam Buchanan, Druv Pai, Peng Wang +1Deep Learning OptimizationRepresentation Learning

  18. Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss

    Jun 4, 2026Thomas T. Zhang, Alok Shah, Yifei Zhang +3Deep Learning Optimization

  19. Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

    Jun 2, 2026Xianliang Li, Zihan Zhang, Weiyang Liu +1Deep Learning OptimizationMomentum Methods

  20. Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks

    May 29, 2026Tianyu Pang, Vignesh Kothapalli, Shenyang Deng +3Deep Learning OptimizationNeural Network Training Dynamics

  21. Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling

    May 29, 2026Dmitrii Feoktistov, Timofey Belinsky, Andrey Veprikov +2Stochastic OptimizationSign-Based Optimization

  22. Inconsistency-Aware Minimization: Improving Generalization with Unlabeled Data

    May 29, 2026Hee-Sung Kim, Hyeonseong Kim, Sungyoon LeeNeural Network GeneralizationDeep Learning Optimization