Convergence

Momentum

51 papers in the last four weeks, up 155% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 390

All topics
CardsList
  1. Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

    Oct 1, 2026Qijia He, Ruinan Jin, Jun Luo +2ConvergenceTrajectory-Level Credit

  2. Convergence Analysis of STORM Under Different Geometries

    Oct 1, 2026Wei Jiang, Yibo Wang, Wenhao Yang +3Stochastic Convex OptimizationConvex Optimization

  3. GRPO Training Dynamics for Small Language Models

    Sep 30, 2026Rajat Ghosh, Vaishnavi Bhargava, Henry Wong +2Convergence

  4. Client and Training Data Selection for Computationally Efficient Synchronized Federated Learning

    Sep 30, 2026Muzaffer Citir, Hiroki Nishikawa, Sangyoung ParkFederated LearningTraining Data

  5. DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence

    Sep 30, 2026Xu Huang, Ye Huang, Zijun Liao +6Generative Image CompressionToken Compression

  6. The Advantages of Fresh Sketching for Ridge Regression

    Sep 29, 2026Linkai Ma, Qilin Li, Petros DrineasKernel Ridge RegressionSketches

  7. Adam under Generalized Smoothness with Second-Moment-Type Stochastic Gradients

    Sep 29, 2026Ruinan Jin, Difei Cheng, Ling Chen +3SmoothnessAdam

  8. Principled MAP estimation for inverse problems: bridging the gap between convergence and performance

    Sep 29, 2026Alexandre Lagier, Valentine Tosel, Anne Gagneux +2Bayesian Inverse ProblemsIterative Denoising Methods

  9. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLarge Language Model PretrainingMuon

  10. An analysis of Mirror-Descent Soft Actor-Critic

    Sep 28, 2026Denis Zorba, Michal ValkoMirror DescentSoft Actor-Critic

  11. Finite-Time Concentration and Convergence Rates for Projected Two-Time-Scale Stochastic Approximation with Markov Noise

    Sep 28, 2026Rahul Singh, Vivek S. Borkar, Eric MoulinesStochastic ApproximationConvergence

  12. The Model Knows When to Stop: Training-Free Early Stopping for Long-Context Reading

    Sep 28, 2026Muath Alyobi, Mohamed Eltahir, Almoayyad Abuljdail +3Efficient Long-Context InferenceLong-Context Reasoning

  13. Averaged Mirror Descent and Dual Gradient Methods: Convergent Algorithms for Entropic Gromov-Wasserstein Problems

    Sep 25, 2026Joanna Marks, Gabriel Rioux, Riccardo PasseggeriGromov--WassersteinMirror Descent

  14. Precise Convergence Speed of Clipped SGD

    Sep 24, 2026David A. R. RobinGradient DescentConvergence

  15. SPADE-DFL: Communication-Efficient Decentralized Federated Learning via Derivative-Free Linearized ADMM

    Sep 24, 2026Mengli Wei, Mengkai Zhu, Jiawen Chen +2Decentralized LearningFederated Learning

  16. Low-Rank Friction for Memory-Efficient Transformer Pretraining

    Sep 24, 2026Rajit Rajpal, Benedict LeimkuhlerAdamTransformer Architectures

  17. EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management

    Sep 23, 2026Liang Mi, Weijun Wang, Bowen Gao +12Offline Reinforcement LearningConvergence

  18. Statistical Rates for Entropic Optimal Transport in the Discrete to SubGaussian Regime

    Sep 22, 2026Tomas Gonzalez, Gonzalo MenaOptimal Transport ApproachNon-Gaussianity

  19. Polyak-Type Extragradient Methods for Monotone Root-Finding Problems

    Sep 22, 2026TaeHo Yoon, Sayantan Choudhury, Ezra Greenberg +1Monotone Variational InequalitiesConvergence

  20. Behavior is Not Enough: A Mechanism-Based Evaluation of Social Norm Emergence in LLM Societies

    Sep 22, 2026Rasika Muralidharan, Haewoon Kwak, Jisun AnSocial DynamicsSocial Norms

  21. Reciprocal Collaboration: how lessons from convergence in GLAMs can enhance interdisciplinary AI research

    Sep 22, 2026Amber L. Cushing, Suzanne Little, Giulia OstiInterdisciplinary ResearchHuman-Ai Collaboration

  22. Neural Approximation by Function Composition: Rigidity and Doubly Exponential Convergence

    Sep 22, 2026Wentao Huang, Haizhang ZhangNeural ApproximationsApproximation

  23. Guaranteed Low-Rank Tensor Recovery from Modewise Measurements via Normalized Block-Weighted Riemannian Gradient Descent

    Sep 21, 2026Yushi Zhou, Feng ZhangLow-Rank StructureConvergence

  24. Adaptive Determinantal Client Scheduling in Federated Learning

    Sep 20, 2026Wen Xu, Ben Liang, Gary Boudreau +1Federated LearningSchedulers

  25. Statistical Convergence of Transformer Encoder-Accelerated Robust Reinforcement Learning

    Sep 20, 2026Suman Banerjee, Hiroyasu TsukamotoOffline Reinforcement LearningValue Functions

  26. The First-Order Oracle Complexity of Lipschitz Convex Optimization in Nondual Settings

    Sep 17, 2026David Martínez-Rubio, Brian Bullins, Cristóbal Guzmán +1Convex OptimizationLipschitz Continuity

  27. Near-Optimal Single-Loop Predictor--Corrector Extragradient Method for Strongly Convex--Strongly Concave Minimax Optimization

    Sep 17, 2026Minhao Zhang, Zi XuConvex OptimizationConvergence

  28. A Convergence Framework for Deep VV-Learning: Error Propagation and Sharp Action-Gap Bounds

    Sep 16, 2026Yury KolomeytsevValue FunctionsOptimal Learner

  29. Revisiting Distributed Sign-Based Variance Reduction

    Sep 16, 2026Wei Jiang, Zechao Li, Lijun ZhangDecentralized OptimizationVariance Reduction

  30. Preservation of Log-Concavity and Convergence of Wasserstein-Fisher-Rao Gradient Flows

    Sep 16, 2026Francesca Romana Crucinio, Sahani PathirajaWasserstein Gradient FlowsLog-Concave Distributions

  31. Self-Evolving Memory for Generative Recommendation

    Sep 14, 2026Xinyu Lin, Zhuosong Jiang, Zixiao Suo +12Real-World Content Recommendation ProblemRecommendation

  32. Improving the Last-Iterate Guarantees of Anytime Algorithms for Stochastic Monotone Variational Inequalities

    Sep 14, 2026Jun-Hyun Kim, Ahmet AlacaogluMonotone Variational InequalitiesConvergence

  33. Convergence rates for generative drifting flows: fixed-scale obstructions and multihead acceleration

    Sep 14, 2026Arthur Stéphanovitch, Eddie AamariGenerative ModelsConvergence

  34. Convergence of Stochastic Gradient Methods under Heavy-Tailed Noise and H"{o}lder Smoothness

    Sep 14, 2026Misbah Uz Zaman, Anirbit MukherjeeStochastic Gradient DescentLipschitz Continuity

  35. Steady-State Convergence of Stochastic Approximation

    Sep 14, 2026Yixuan Zhang, Qiaomin XieStochastic ApproximationConvergence

  36. Almost Sure Convergence Analysis of Stochastic Gradient Methods with Clipping and Additive Noise

    Sep 10, 2026Amartya Mukherjee, Jun LiuStochastic Gradient DescentGradient Clipping

  37. Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers

    Sep 8, 2026Amit Ben-Artzy, Roy SchwartzTransformer ArchitecturesRepresentational Capacity

  38. The Exact Time-Uniform Rate Frontier for Stochastic Gradient Descent on Smooth Convex Objectives

    Sep 8, 2026Ruijie Li, Kang Chen, Tianyu WangStochastic Gradient DescentConvergence

  39. Non-Coherent Over-the-Air Federated Learning: Protocol, Convergence, and Device Scheduling

    Sep 8, 2026Haifeng Wen, Nicolò Michelusi, Osvaldo Simeone +2Federated LearningPower Allocation

  40. Parallelism Strategy Chaining for Fast Training Convergence

    Sep 7, 2026Minchul Kang, Changyong Shin, Younghun Go +4Large Language Model TrainingLanguage Model Perplexity

  41. No-Regret Bayesian Optimization with Finite-Library Input-Warped Kernels

    Sep 2, 2026Edvin Ketabati Augustinsson, Robert A. BridgesBayesian OptimizationGaussian Process

  42. Convergence Theory of Knowledge Distillation in Asynchronous P2P Gossip Learning Network

    Sep 1, 2026Lucas Qingyang Fang, Tiyao Liu, Jinhao Jing +4Knowledge DistillationGossip

  43. Independent Reinforcement Learning in Discounted Markov Games

    Sep 1, 2026Asrin Efe Yorulmaz, Ugur Aydin, Tamer BasarMean Field GamesMulti-Agent Reinforcement Learning

  44. RestoreBench: Can AI Agents Restore Power Flow Convergence?

    Aug 31, 2026Riccardo Mansutti, Andrea Pomarico, Robert Jakob +3Power SystemsOptimal Power Flow

  45. A Globally Convergent Algorithm for Total Scaled-Gradient Variation via Cone-Constrained Bilinear Decomposition

    Aug 29, 2026Haibin Su, Chunlin Wu, Huibin Chang +1Image RestorationConvergence

  46. A Finite-Sample Analysis of Quantile Temporal-Difference Learning

    Aug 27, 2026Zijie Cheng, Xiang Li, Yang Peng +1Temporal DifferenceConvergence