Asynchronous RL

RL: Reinforcement Learning

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 27

All topics
CardsList
  1. A Closed-Loop Non-Asymptotic Convergence Analysis of PPO with Learned Critics and Clipping

    Oct 7, 2026Junwei Su, Mengfan Liu, Yanyong Zhang +1Proximal Policy OptimizationActor-Critic Methods

  2. COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

    Oct 7, 2026Zicheng Hu, Zhijian Zhou, Xuan Zhang +7Asynchronous RLRL Post-Training

  3. Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

    Oct 1, 2026Qijia He, Ruinan Jin, Jun Luo +2Asynchronous RLRL for Language Model Reasoning

  4. Sharp Statistical Rates for Asynchronous TD Learning with Markovian Data

    Sep 30, 2026Yang PengAsynchronous RLStochastic Approximation

  5. Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training

    Sep 29, 2026Chenliang Li, Neiwen Ling, Zijun Wei +1Asynchronous RLRL for Language Model Reasoning

  6. EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management

    Sep 23, 2026Liang Mi, Weijun Wang, Bowen Gao +12Asynchronous RLReinforcement Learning

  7. High-Probability Nash Regret for Decentralized Learning in Markov αα-Potential Games: Episodic and Fully Online Asynchronous Algorithms with Applications to Markov Congestion Games

    Sep 14, 2026S. Rasoul EtesamiPolicy GradientAsynchronous RL

  8. BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL

    Sep 9, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +3Asynchronous RLOff-Policy RL

  9. TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling

    Aug 11, 2026Yanyu Ren, Xizheng Wang, Xiao Liu +8Agentic RLAsynchronous RL

  10. Learning under Opponent Unawareness in Linear-Quadratic Stochastic Games

    Aug 8, 2026Dantong Chu, Xuefeng Gao, Yufei ZhangNash EquilibriumAsynchronous RL

  11. Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning

    Jul 24, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +5Asynchronous RLRL for Language Model Reasoning

  12. Robust Asynchronous Q-Learning under Reward and State Corruption via Batching

    Jul 23, 2026Sreejeet Maity, Aritra MitraAsynchronous RLQ-Learning

  13. CHMAS: A Coupled Hierarchical Framework for Multi-Agent Reinforcement Learning

    Jul 21, 2026Dongming Wang, Jie Xu, Yanyu Zhang +1Multi-Agent CoordinationAsynchronous RL

  14. Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    Jul 21, 2026Junyao Yang, Yucheng Shi, Zongxia Li +6Asynchronous RLProximal Policy Optimization

  15. Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

    Jul 8, 2026Zhenyu Hou, Yujiang Li, Jie Tang +1Agentic RLAsynchronous RL

  16. Scaling Laws for Collapse in Asynchronous GRPO

    Jul 1, 2026Jingwei Song, Haofeng Xu, Jie Xiao +7Asynchronous RLReinforcement Learning

  17. Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF

    Jun 25, 2026Arnav RajAsynchronous RLReinforcement Learning

  18. AsyncWebRL: Efficient Multi-Step RL for Visual Web Agents

    Jun 4, 2026Hao Bai, Rui Yang, Chenlu Ye +3Asynchronous RLReinforcement Learning

  19. Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

    May 12, 2026Zhong Guan, Yongjian Guo, Haoran Sun +5Asynchronous RLReinforcement Learning

  20. MARLaaS: Multi-Tenant Asynchronous Reinforcement Learning as a Service

    May 8, 2026Timothy Tin Long Yu, Gursimran Singh, Ge Shi +3Asynchronous RLReinforcement Learning

  21. AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training

    Date pendingZhenyu Han, Ansheng You, Haibo Wang +16RL for Language ModelsAsynchronous RL