Learning Rate Scheduling

Latest papers 39

All topics
CardsList
  1. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenLanguage Model PretrainingDeep Learning Optimization

  2. How Does Local Landscape Geometry Evolve in Language Model Pre-Training?

    Sep 30, 2026Zhanpeng Zhou, Yuhan Sun, Bingrui Li +4Language Model PretrainingLearning Rate Scheduling

  3. SOLAR: A State-Driven Online Learning Rate Scheduler for LLM Pretraining

    Sep 28, 2026Qiulin Shang, Binyu Wang, Yongqi Qiao +3Language Model PretrainingLearning Rate Scheduling

  4. The Exact Time-Uniform Rate Frontier for Stochastic Gradient Descent on Smooth Convex Objectives

    Sep 8, 2026Ruijie Li, Kang Chen, Tianyu WangLearning Rate SchedulingLast-Iterate Convergence

  5. BrachistoneLR: A Brachistochrone-Inspired Learning-Rate Schedule and a Controlled Benchmark of Scheduling Policies

    Sep 8, 2026Md. Sadekur Rahman Roni, Md. Jalal uddin Chowdhury, Moutusi Dash NimiDeep Learning OptimizationLearning Rate Scheduling

  6. When Does Online Adaptation Pay on the Edge? A Leakage-Free Evaluation of Warmup, Learning-Rate Selection, and Resource Trade-offs for Time-Series Forecasting

    Sep 1, 2026Takumi Fujimoto, Hiroaki NishiMultivariate Time Series ForecastingLearning Rate Scheduling

  7. Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

    Aug 28, 2026Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan +4Language Model PretrainingLearning Rate Scheduling

  8. A lower bound for stepsize-based acceleration of gradient descent

    Aug 11, 2026Jianhao Ma, Yuxin ChenLearning Rate SchedulingLast-Iterate Convergence

  9. Learning from the Descent Direction: Adaptive Gradient Descent under One-Sided Hölder Regularity

    Jul 24, 2026Arzu Ahmadova, Ismail HuseynovLearning Rate SchedulingNonconvex Optimization

  10. Hyperball May Not Be a Free Lunch

    Jul 24, 2026Yihao Xiao, Jialong Sun, Zitian Gao +5Learning Rate SchedulingNeural Network Optimization

  11. Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps

    Jul 14, 2026Subham Singh, Ashutosh Mishra, Subha RautLearning Rate SchedulingGradient Descent

  12. WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training

    Jul 12, 2026Jianhao Ma, Yuxin ChenLearning Rate Scheduling

  13. Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles

    Jul 10, 2026Jiseok Chae, Donghwan KimLearning Rate SchedulingOptimization Convergence Analysis

  14. Systematic Evaluation of Learning Rate Scheduling Strategies Across Heterogeneous Architectures

    Jul 9, 2026Hafsa Mateen, Radu Timofte, Dmitry IgnatovLearning Rate SchedulingNeural Network Optimization

  15. Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks

    Jul 8, 2026Yedi Zhang, Peter E. Latham, Leena Chennuru Vankadara +1Learning Rate SchedulingDeep Linear Networks

  16. Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules

    Jun 29, 2026Muhammad Hamza, Ayush GoelLearning Rate SchedulingStochastic Optimization Convergence

  17. Muown Implicitly Performs Angular Step-size Decay

    Jun 22, 2026Florian Hübler, Kai Lion, Antonio Orvieto +1Learning Rate SchedulingRiemannian Optimization

  18. Adaptive Sharpness-Aware Minimization with a Polyak-type Step size: A Theory-Grounded Scheduler

    Jun 1, 2026Dimitris Oikonomou, Nicolas LoizouSharpness-Aware MinimizationLearning Rate Scheduling

  19. Accelerating Min-Max Optimization via Power-Law Stepsizes

    Jun 1, 2026Yue Wu, Weiqiang Zheng, Yang Cai +1Learning Rate SchedulingLast-Iterate Convergence

  20. Agile Online Model Selection: Resolving Adaptation Lag via Safeguarded Large Learning Rates

    May 26, 2026Kei Takemura, Ryuta Matsuno, Keita SakumaLearning Rate Scheduling

  21. Anytime Training with Schedule-Free Spectral Optimization

    May 21, 2026Anuj Apte, Pranav Deshpande, Niraj Kumar +2Deep Learning OptimizationLearning Rate Scheduling

  22. One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs

    May 21, 2026Di He, Songjun Tu, Keyu Wang +2Learning Rate SchedulingEfficient Language Model Training

  23. Fine-Tuning Without Forgetting via Loss-Adaptive Learning Rates

    May 19, 2026Parjanya Prajakta Prashant, Jiongli Zhu, Aldan Creo +1Learning Rate SchedulingLLM Fine-Tuning

  24. Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

    May 7, 2026Ziqing Wen, Zhouyang Liu, Jiahuan Wang +4Deep Learning OptimizationLearning Rate Scheduling

  25. Learning Rate Engineering: From Coarse Single Parameter to Layered Evolution

    Apr 30, 2026Ming-Hong Yao, Di Wang, Jian Cui +5Deep Learning OptimizationFine-Tuning

  26. Optimal Learning Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay

    Feb 6, 2026Binghui Li, Zilin Wang, Fengling Chen +3Learning Rate SchedulingKernel Regression

  27. Why Do We Need Warm-up? A Theoretical Perspective

    Oct 3, 2025Foivos Alimisis, Rustem Islamov, Aurelien LucchiDeep Learning OptimizationLearning Rate Scheduling

  28. ExpTest: Loss-Curve Hypothesis Testing for Autonomous Learning-Rate Selection in Deep Neural Networks

    Date pendingZan Chaudhry, Naoko MizunoLearning Rate SchedulingNeural Network Training Dynamics