Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. CATPO: Critique-Augmented Tree Policy Optimization

    Jun 6, 2026Ayush Singh, Umang Goyal, Ankur DahiyaRL for Language ModelsReinforcement Learning

  2. Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies

    Jun 6, 2026Ashkan Ansarifard, Matteo Mancanelli, Elena Umili +1Reinforcement LearningTransformer-Based RL

  3. Are Good Generators Good Decision-Makers? Policy Learning for General Interventions via Retargeted Counterfactual Generation

    Jun 5, 2026Raphael C Kim, Jingsen Zhu, Ramin Zabih +1Reinforcement LearningCausal Counterfactual Generation

  4. Self-evolving LLM agents with in-distribution Optimization

    Jun 5, 2026Yudi Zhang, Meng Fang, Zhenfang Chen +1Reinforcement LearningProcess Reward Models

  5. Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes

    Jun 5, 2026Hikaru Shindo, Yu Deng, Teng Cao +5Reinforcement LearningWorld Models

  6. StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

    Jun 5, 2026Haojie Hao, Longkun Hao, Yihang Lou +8Reinforcement LearningRL for GUI Agents

  7. Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

    Jun 5, 2026Yijin Zhou, Linqian Zeng, Xiaoya Lu +4Reinforcement LearningLLM Uncertainty Estimation

  8. Performance Variation in Deep Reinforcement Learning

    Jun 4, 2026Haruto Tanaka, A. Rupam MahmoodReinforcement Learning

  9. Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

    Jun 4, 2026Ujjwal Bhatta, Utsabi Dangol, Sumaly Bajracharya +2Reinforcement LearningLLM-Guided RL

  10. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  11. Maximising the Set-Piece Return: Optimising Football Corner Tactics with Graph Reinforcement Learning

    Jun 4, 2026Sean Groom, Michael Groom, Francisco Belo +4Reinforcement Learning

  12. Reward hacking in physical reinforcement learning revealed by turbulent drag reduction

    Jun 4, 2026Giorgio Maria Cavallazzi, Miguel Pérez-Cuadrado, Alfredo PinelliRL ControlReward Hacking

  13. Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

    Jun 4, 2026Haoyang Hong, Zichen Wang, Quanquan Gu +1Regret Minimization in RLReinforcement Learning

  14. Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

    Jun 4, 2026Yuxiao Ye, Haoran He, Fangyuan Kong +4Reinforcement LearningImage Editing Evaluation

  15. Accelerating and Scaling MPC-Guided Reinforcement Learning for Humanoid Locomotion and Manipulation

    Jun 4, 2026Junheng Li, Liang Wu, Sergio A. Esteban +3RL ControlHumanoid Robot Locomotion

  16. AsyncWebRL: Efficient Multi-Step RL for Visual Web Agents

    Jun 4, 2026Hao Bai, Rui Yang, Chenlu Ye +3Asynchronous RLReinforcement Learning

  17. BMCR: Adaptive Backbone Module Composition via Reinforcement Learning for Remote Sensing Object Detection

    Jun 4, 2026Wenlin Liu, Xikun Hu, Ping ZhongReinforcement LearningDynamic Neural Networks

  18. Representation Learning Enables Scalable Multitask Deep Reinforcement Learning

    Jun 4, 2026Johan Obando-Ceron, Lu Li, Scott Fujimoto +3Reinforcement LearningRepresentation Learning for RL

  19. Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

    Jun 3, 2026Chirag Chawla, Rohan Charudatt Salvi, Madhav S. BaidyaReinforcement LearningRL for Language Model Reasoning

  20. Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

    Jun 3, 2026Dae Yon Hwang, Raunaq Suri, Valentin Villecroze +4Reinforcement LearningBayesian RL

  21. GARL: Game-Theoretic Reinforcement Learning for Multi-Agent Strategic Prioritisation

    Jun 3, 2026Yuxiao Ye, Yiwen Zhang, Huiyuan Xie +2Multi-Agent LLM SystemsMulti-Agent System Optimization

  22. Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

    Jun 3, 2026Xuekang Wang, Zhuoyuan Hao, Shuo Hou +3Reward HackingRL for Language Models

  23. Bayesian learning for the stochastic shortest path problem

    Jun 3, 2026Chon Wai Ho, Sumeetpal S. Singh, Jiaqi GuoMarkov Decision ProcessesReinforcement Learning

  24. Fog of Love: Engineering Virtuous Agent Behavior with Affinity-based Reinforcement Learning in a Game Environment

    Jun 3, 2026Ajay Vishwanath, Christian OmlinReinforcement LearningCooperative MARL

  25. Explainably Safe Reinforcement Learning

    Jun 3, 2026Sabine Rieder, Stefan Pranger, Debraj Chakraborty +2Reinforcement LearningInterpretability in RL

  26. Episodic Memory Temporal Consistency for Cooperative Multi-Agent Reinforcement Learning

    Jun 3, 2026Zicheng Zhao, Yu Lan, Chengzhengxu Li +2Reinforcement LearningGame-Playing Agents