Reinforcement Learning

Also known as RL

Momentum

143 papers in the last four weeks, up 233% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,147

All topics
CardsList
  1. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  2. MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary

    Sep 29, 2026Shengyun Zhong, Xinkang Zhao, Ziyuan Chu +1Reinforcement LearningVideo-Language Models

  3. Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL

    Sep 29, 2026Mathias Jackermeier, Jacques Cloete, Alessandro AbateRL BenchmarksReinforcement Learning

  4. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation

  5. SCA: Spatial Credit Assignment for Reinforcement Learning of GUI Agents

    Sep 29, 2026Shengtian Yang, Ziyu Xiong, Kaibing Yang +6Reinforcement LearningRL for GUI Agents

  6. State Trace Rationale As Auxiliary Task in Reinforcement Learning

    Sep 29, 2026Muhammad U. Nasir, Alex Vogt, Steven D. James +1Reinforcement LearningRepresentation Learning for RL

  7. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4RL for Language ModelsReinforcement Learning

  8. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Reinforcement LearningProcess Reward Models

  9. SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

    Sep 29, 2026Zihao Chen, Fanxiang Xiong, Hongran Ren +6Reinforcement LearningRL for Language Model Reasoning

  10. BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

    Sep 29, 2026Quan Xiao, Mingda Liu, Gaowen Liu +2Reinforcement LearningAgentic RAG

  11. Massively Parallel Reinforcement Learning with a Chaotic Reconfigurable Clockless Chip

    Sep 28, 2026Eric Oliveira-Gomes, Damien RontaniReinforcement LearningChaotic Dynamical Systems

  12. ChronoSRL: Temporal Geometry for Self-Supervised Reinforcement Learning

    Sep 28, 2026Nico Bohlinger, Jan PetersRL for RoboticsRepresentation Learning

  13. X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets

    Sep 28, 2026Prithwish Dan, Chenyang Ma, Wei ZhanReinforcement LearningGeneralization in Robotic Manipulation

  14. Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning

    Sep 28, 2026Hanbin Zhou, Shangzhe Li, Alexander Braverman +1Reinforcement LearningAdversarial Imitation Learning

  15. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning

  16. Behavioral Foundation Models for Quality Diversity

    Sep 28, 2026Nazim Bendib, Nicolas Perrin-Gilbert, Olivier SigaudReinforcement LearningQuality-Diversity Optimization

  17. An analysis of Mirror-Descent Soft Actor-Critic

    Sep 28, 2026Denis Zorba, Michal ValkoReinforcement LearningOnline Mirror Descent

  18. Passive-Dynamic-Walking-Inspired Dynamics Guidance for Energy-Efficient Humanoid Locomotion

    Sep 28, 2026Hyeonjin Choi, Joongheon Kim, Daekyum KimHumanoid Robot LocomotionReinforcement Learning

  19. Teach to Learn: Hint Annealing for Self-improving LLM Reasoning

    Sep 28, 2026Zile Wang, Zijian Li, Haodong Wang +5Reinforcement LearningSelf-Training for Language Models

  20. Learning High-Risk High-Precision Motion Control

    Sep 28, 2026Nam Hee Kim, Markus Kirjonen, Perttu HämäläinenRobotic ControlReinforcement Learning

  21. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Agentic RLReinforcement Learning

  22. Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization

    Sep 28, 2026Zhiyuan Ma, Jiaming Li, Lingzhen Li +7Reinforcement LearningVision-Language-Action Models

  23. FlexLoop: Depth-Elastic Looped Policies for Adaptive Test-Time Computation in Deep RL

    Sep 28, 2026Xun Wang, Ruishuo Chen, Yu Chen +2Efficient Neural Network InferenceReinforcement Learning

  24. Escaping Local Views: Discovering Latent Concepts for Interpretable Multi-Agent Reinforcement Learning

    Sep 28, 2026Yijie Sun, Sanquan Sun, Yanda Zhu +3Reinforcement LearningPartially Observable RL

  25. LLMs as Adaptive Meta-Solvers: Strategy-Diverse RL for Industrial-Scale Optimization

    Sep 28, 2026Shihao Zhang, Weiting Liu, Siyu Shao +4Algorithm SelectionReinforcement Learning

  26. Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Jifeng Hu +5Reinforcement LearningTransformer-Based RL

  27. DexTaG: Tactile-as-Guidance in Reinforcement Learning for Dexterous Manipulation

    Sep 27, 2026Han Yang, Yian Wang, Yunlong Song +2Reinforcement LearningContact-Rich Robotic Manipulation

  28. QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    Sep 27, 2026Weiqi Wang, Yuxin Zhou, Mouxiang Chen +9Reinforcement LearningLong-Horizon Agent Tasks

  29. Principal Steering Subspaces for Online Adaptation of Frozen Generative Robot Policies

    Sep 27, 2026Jialeng Ni, Nathan Zhao, Kunpeng SongRobot Policy LearningReinforcement Learning