Batch

Momentum

25 papers in the last four weeks, up 127% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 134

All topics
CardsList
  1. A Solvable Model of Adaptive Learning Rate Rescaling: Acceleration, Stability & Scaling

    Oct 5, 2026Itay Lavie, Clarissa Lauditi, Cengiz PehlevanBatch

  2. Learning Rate Transfer for Hybrid Transformer-SSM Architectures

    Oct 1, 2026Jimin Seo, Gyubok Lee, Yeonsik Jo +11Hybrid TransformerTransformer Architectures

  3. Every Batch Is Its Own Validation Set: Leave-One-Out Gradient Matching for Online Data Selection in LLM Fine-Tuning

    Sep 30, 2026Hongyu Chen, Xinyi Luo, Ming Zhao +6Large Language Model Fine-TuningBatch

  4. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenBatchStochastic Gradient Descent

  5. How Does Local Landscape Geometry Evolve in Language Model Pre-Training?

    Sep 30, 2026Zhanpeng Zhou, Yuhan Sun, Bingrui Li +4Large Language Model PretrainingBatch

  6. AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

    Sep 29, 2026Pengyu He, Yan Zhang, Ruien Li +1Large Language Model TrainingBatch

  7. Fast Learning Rate Transfer in Shallow Linear Networks at Growing Training Horizons

    Sep 28, 2026Mana Sakai, Masaaki ImaizumiBatch

  8. Muon Sublates the Edge of Stability in LLM Pretraining

    Sep 28, 2026Yanzhe Chen, Qifang Zhao, Xiaoxiao Xu +1MuonLarge Language Model Alignment

  9. SOLAR: A State-Driven Online Learning Rate Scheduler for LLM Pretraining

    Sep 28, 2026Qiulin Shang, Binyu Wang, Yongqi Qiao +3BatchLarge Language Model Pretraining

  10. Causal Routing for Unlearning

    Sep 28, 2026Bardh Prenkaj, Andrea D'Angelo, Davide Mottin +4Large Language Model MemoryCausal

  11. Activation-Flexible ANN-to-SNN Conversion with Finite-State Markov Neurons

    Sep 24, 2026Ruiyu Jia, Zhuo-Cheng XiaoSpiking Neural NetworksActivation Functions

  12. Industrial Anomaly Detection via Defect-Grounded Reasoning in Visual Latent Space

    Sep 24, 2026Jaron Yeh, Yen-Wei Chang, Jiang Liu +1Latent Visual ReasoningEfficient Latent Reasoning

  13. Does Step Law Transfer to Small-Scale Language Models? An Empirical Recalibration Below 59M Parameters

    Sep 23, 2026Egor Romanyukov, Timofey Novikov, Timur Shokarov +3BatchSmall Large Language Models

  14. Terminal Shrinkage Averaging Reveals a Schedule-Estimator Interaction in LLM Pretraining

    Sep 21, 2026Adam Ousherovitch, Yixin WangBatchLarge Language Model Pretraining

  15. Fast Learning Rates for Physics-Informed Kernel Methods

    Sep 16, 2026Luc Brogat-Motte, Joachim Bona-Pellissier, Giacomo Meanti +1Physics-Informed LearningNonlinear Operators

  16. Federated stochastic bilevel optimization with fully first-order gradients

    Sep 14, 2026Yihan Zhang, Rohit Dhaipule, Chiu C Tan +2Bilevel OptimizationGradient Descent

  17. Generalization Analysis of Distributed Kernel-based Robust Gradient Descent Algorithms

    Sep 10, 2026Jun-Yi Meng, Zheng-Chu Guo, Yuan MaoDistributionally-Robust OptimizationStochastic Gradient Descent

  18. Equivariance Breaks the Learning Rate

    Sep 8, 2026Andrei Manolache, Mathias NiepertAdamEquivariant Neural Networks

  19. BrachistoneLR: A Brachistochrone-Inspired Learning-Rate Schedule and a Controlled Benchmark of Scheduling Policies

    Sep 8, 2026Md. Sadekur Rahman Roni, Md. Jalal uddin Chowdhury, Moutusi Dash NimiBatchAnnealing

  20. TASTE: Throughput-Aware Batch Size Tuning for On-Device Edge Learning

    Sep 7, 2026Avik Bhatnagar, Federico Nicolas Peccia, Oliver BringmannEdge DevicesBatch

  21. Post-Training Science for Supervised Fine-Tuning

    Sep 1, 2026Charles O'Neill, Mudith Jayasekara, Harry PartridgeModel Fine-TuningBatch

  22. When Does Online Adaptation Pay on the Edge? A Leakage-Free Evaluation of Warmup, Learning-Rate Selection, and Resource Trade-offs for Time-Series Forecasting

    Sep 1, 2026Takumi Fujimoto, Hiroaki NishiNon-StationarityTime Series Forecasting

  23. Stochastic Optimization of Tree Tensor Networks

    Sep 1, 2026Marius Willner, Maximilian Scharf, André Uschmajew +2Tensor NetworksNeural Network Optimization

  24. WHALE: A Simple Recipe for Joint Harness-Weight Optimization

    Aug 31, 2026Haechan Kim, Yoonho Lee, Gisang Lee +2Agent HarnessAgentic Optimization

  25. Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

    Aug 28, 2026Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan +4BatchScaling Laws

  26. Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training

    Aug 19, 2026Zachary Speck, Asa ShepardTraining DataBatch

  27. Sustaining Plasticity via Learnable Wavelet Activations in Continual Learning

    Aug 13, 2026Zeyang Zhang, Tieliang Gong, Junyan Lu +1Replay-Based Continual LearningContinual Learning

  28. Direct Acceleration of Stochastic Root-Finding Without Variance Reduction and Regularization

    Aug 12, 2026TaeHo Yoon, Nicolas LoizouStochastic ApproximationVariance Reduction

  29. Batch Size or Negatives? A Selection Rule for Memory-Constrained Recommender Training

    Aug 11, 2026Artyom Sabitov, Daniil Volkov, Alexey ZaytsevReal-World Content Recommendation ProblemBounded-Memory

  30. FedA2L: Adaptive layer-wise learning rate adjustment in decentralized federated learning

    Aug 10, 2026Van Truong Vo, Khoa Nguyen, Taehong KimFedavgBatch

  31. Modular TTT: Rethinking Test-Time Training as Composable Modules

    Aug 7, 2026Bohao Tang, Zhen Qin, Yuqi Pan +3Test-Time TrainingSequence Modeling

  32. A Rate Separation for Agnostic Direct Sums

    Aug 7, 2026Mihir More, Aritra Das, Debayan GuptaLearnabilityBatch

  33. Optimal Training-Time Scaling in Gradual Adaptation

    Aug 5, 2026Zonghuan Xu, Krishna HarishBatchTraining Time

  34. LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

    Aug 4, 2026Fengqi Zhu, Shaoxuan Xu, Jingyang Ou +11Mixture-Of-Experts Large Language ModelsMixture-Of-Experts

  35. Towards joint scaling laws with optimal batch size schedules

    Jul 30, 2026Jiaxiang Li, Zhiqi Bu, Shiyun XuBatchLarge Language Model Training

  36. Scale Weight Decay and Train Better

    Jul 26, 2026Anuj ApteWeight DecayBatch

  37. Hyperball May Not Be a Free Lunch

    Jul 24, 2026Yihao Xiao, Jialong Sun, Zitian Gao +5BatchAdaptive Optimizers

  38. Learning Faster without Deeper Networks: A*-Inspired Batch Selection for Efficient CNN Training

    Jul 17, 2026Anxhelo Shehu, Enes Stastoli, Arben CelaResnet-18Convolutional Neural Networks

  39. A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

    Jul 14, 2026Chengguang Gan, Zhixi Cai, Yunhao Liang +3Verifiable RewardsBatch

  40. Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps

    Jul 14, 2026Subham Singh, Ashutosh Mishra, Subha RautBatchBatch Normalization

  41. WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training

    Jul 12, 2026Jianhao Ma, Yuxin ChenBatchWarm Starts

  42. Index SLM Technical Report

    Jul 10, 2026Lusheng Zhang, Shien He, Tianxing Yan +5Small Large Language ModelsInstruction

  43. LionVote: Per-Layer Learning Rate Adaptation for Lion

    Jul 10, 2026Kris AtallahBatchLayer-Wise

  44. Systematic Evaluation of Learning Rate Scheduling Strategies Across Heterogeneous Architectures

    Jul 9, 2026Hafsa Mateen, Radu Timofte, Dmitry IgnatovBatchNeural Architecture Search

  45. Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

    Jul 8, 2026Tommaso Cerruti, Tim Rieder, George Rowlands +2Kimi Delta AttentionLinear Attention

  46. Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks

    Jul 8, 2026Yedi Zhang, Peter E. Latham, Leena Chennuru Vankadara +1BatchSequential Scaling

  47. ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction

    Jul 6, 2026Xinze Li, Yiyuan Wang, Pengxu Chen +43D ReconstructionRecurrent State

  48. Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam

    Jul 4, 2026Ashmitha R, Jörg FrochteAdamSharpness-Aware Minimization