0 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.
Aug 31, 2026·Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan +1Group Relative Policy OptimizationPolicy Optimization
University of Toronto · Amazon
Jul 24, 2026·Guanqun Zhao, Zijun Xie, Binbin Zheng +5Asynchronous RLRL for Language Model Reasoning
Beijing University of Posts and Telecommunications · Baidu Inc. · Peking University +1
Jul 21, 2026·Junyao Yang, Yucheng Shi, Zongxia Li +6Asynchronous RLProximal Policy Optimization
1Tencent Hy LLM Frontier · 2National University of Singapore · University of Maryland, College Park +3
Jun 24, 2026·Bang Giang Le, Viet Cuong TaSequential MARLTrust Region Policy Optimization
Human Machine Interaction Laboratory, VNU University of Engineering and Technology, 144 Xuan Thuy, Cau Giay, 100000, Hanoi, Vietnam.
Jun 16, 2026·Zijie Meng, Ziwei Li, Yufei Liu +5Cyber-Physical SystemsReinforcement Learning
Peking University · National Taiwan University · WHU +1
Jun 11, 2026·Yao-hua Franck Xu, Tayeb Lemlouma, Jean-Marie Bonnin +1Algorithmic FairnessPolicy Optimization
Orange Innov Lannion, France · IRISA Université de Rennes Lannion, France · IRISA IMT Atlantique Rennes, France
Jun 8, 2026·Jiarui Yao, Xiangxin Zhou, Penghui Qi +3RL for Language ModelsPolicy Optimization
1Tencent Hunyuan · 2UIUC · 3NUS
Jun 2, 2026·Bingxu Liu, Jiashun Liu, Johan Obando-Ceron +5Non-Stationary RLReinforcement Learning
Hong Kong University of Science and Technology · Fudan University · Mila - Québec AI Institute +2
May 26, 2026·Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Reinforcement LearningKL-Regularized RL
1KAIST AI · 2Seoul National University · 3RLWRLD
May 10, 2026·Anish Diwan, Davide Tateo, Christopher E. Mower +3Reinforcement LearningPolicy Optimization
Technical University of Darmstadt · Robotics Institute Germany (RIG) · Lund University +3
May 9, 2026·Chulabhaya Wijesundara, Andrea Baisero, Zhongheng Li +3Multi-Agent System OptimizationPolicy Optimization
Northeastern University · STR · University of California, Irvine
May 4, 2026·Yiheng Zhang, Yiming Wang, Kaiyan Zhao +3Policy Gradient MethodsProximal Policy Optimization
University of Macau · Wuhan University · National University of Singapore +1
Apr 20, 2026·Yunke Ao, Le Chen, Bruce D. Lee +5Reinforcement LearningGroup Relative Policy Optimization
ETH Zurich · MPI for Intelligent Systems · University of Alberta +2
Feb 4, 2026·Doyeon Lee, Eunyi Lyou, Hyunsoo Cho +3RL for Language Model ReasoningPolicy Optimization
Seoul National University · Department of Artificial Intelligence / Institute for Multiscale Matter and Systems, Ewha Woman University · Geogia Institute of Technology
Dec 29, 2025·Dominik Wagner, Ankit Kanwar, Luke OngSafety-Critical ControlPolicy Optimization
NTU Singapore · Sony Corporation
Dec 28, 2025·Yingru Li, Jiacai Liu, Jiawei Xu +4RL for Language ModelsReinforcement Learning
Fudan University · The Chinese University of Hong Kong, Shenzhen