Warm Starts

Momentum

2 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 26

All topics
CardsList
  1. SOLAR: A State-Driven Online Learning Rate Scheduler for LLM Pretraining

    Sep 28, 2026Qiulin Shang, Binyu Wang, Yongqi Qiao +3BatchLarge Language Model Pretraining

  2. When Does Online Adaptation Pay on the Edge? A Leakage-Free Evaluation of Warmup, Learning-Rate Selection, and Resource Trade-offs for Time-Series Forecasting

    Sep 1, 2026Takumi Fujimoto, Hiroaki NishiNon-StationarityTime Series Forecasting

  3. Simple-OPD: Demystifying Warm-up for On-policy Distillation

    Aug 7, 2026Tao Liu, Taiqiang Wu, Mao Zheng +5Uni-OpdWarm Starts

  4. Guiding Posterior Exploration with Optimizer-Derived Geometry

    Jul 28, 2026Moritz Schlager, Emanuel Sommer, Thomas Möllenhoff +1Adaptive SamplingBayesian Neural Networks

  5. WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training

    Jul 12, 2026Jianhao Ma, Yuxin ChenBatchWarm Starts

  6. When Is an LLM Worth It for Hyperparameter Optimization? A Budget-Matched Study on Tabular Data Finds the Warm-Start Is a Default Configuration, Not the Model

    Jun 19, 2026Carson Rodrigues, Oysturn Vas, Isaiah Abner DCosta +1Mllm-BasedWarm Starts

  7. Taming Curvature: Architecture Warm-Up for Stable Transformer Training

    Jun 15, 2026Sameera Ramasinghe, Ajanthan Thalaiyasingam, Hadi Mohaghegh Dolatabadi +6Curvature-Aware Spectral FrameworkTransformer Architectures

  8. Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms

    Jun 1, 2026Zixuan Jin, Wenzhuo Zhang, Shuxian Quan +4SwarmsPhysics-Informed Learning

  9. Information-Directed Offline-to-Online Reinforcement Learning

    May 28, 2026Keru ChenModel-Based Reinforcement LearningMutual Information

  10. When is Warmstarting Effective for Scaling Language Models?

    May 13, 2026Neeratyoy Mallik, Maciej Janowski, Johannes Hog +4Warm StartsLarge Language Model Training

  11. FreeMOCA: Memory-Free Continual Learning for Malicious Code Analysis

    May 10, 2026Zahra Asadi, Haeseung Jeon, Sohyun Han +3MalwareReplay-Based Continual Learning

  12. ZAYA1-8B Technical Report

    May 6, 2026Robert Washbourne, Rishi Iyer, Tomas Figliolia +15DeepseekMixture-Of-Experts

  13. First Shape, Then Meaning: Efficient Geometry and Semantics Learning for Indoor Reconstruction

    May 5, 2026Remi Chierchia, Léo Lebrat, David Ahmedt-Aristizabal +3Neural ReconstructionEfficient Planning

  14. μμpscaling small models: Principled warm starts and hyperparameter transfer

    Feb 11, 2026Yuxin Ma, Nan Chen, Mateo Díaz +3HyperparameterNeural Network Training

  15. Optimal Learning Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay

    Feb 6, 2026Binghui Li, Zilin Wang, Fengling Chen +3BatchScaling Laws

  16. Warm-Starting Iterative Gaussian Processes for Faster Sequential Inference

    Nov 20, 2025Alan Yufei Dong, Jihao Andreas Lin, José Miguel Hernández-LobatoGaussian ProcessWarm Starts

  17. Why Do We Need Warm-up? A Theoretical Perspective

    Oct 3, 2025Foivos Alimisis, Rustem Islamov, Aurelien LucchiWarm StartsBatch