Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. SLPO: Scaling Latent Reasoning via a Surrogate Policy

    Jul 22, 2026Runyang You, Zhiyuan Liu, Yongqi Li +1Reinforcement LearningRL for Language Model Reasoning

  2. Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

    Jul 21, 2026Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou +4Reinforcement LearningRL for Language Model Reasoning

  3. A Reinforcement-Learning-Augmented Liquid-Fueled Reactor Network Model for Predicting Lean Blowout in Gas Turbine Combustors

    Jul 21, 2026Philip John, Eloghosa Ikponmwoba, Pinaki Pal +1Reinforcement LearningReduced-Order Modeling

  4. Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation

    Jul 21, 2026Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun HuangReinforcement LearningOffline RL

  5. Comparative Study of Multi-Agent Actor-Critic Algorithms in Parameterized Action Reinforcement Learning

    Jul 21, 2026Ubayd Ali Bapoo, Clement N NyirendaReinforcement LearningSoft Actor-Critic

  6. Reinforcement Learning for Delivery Drone-Based Participatory Sensing in Dynamic Environments

    Jul 21, 2026Xin Ouyang, Songxin Lei, Xusen Guo +3RL ControlReinforcement Learning

  7. From Trajectories to Instructions: Language-Conditioned Meta-Reinforcement Learning

    Jul 21, 2026Garvit Singla, Uma Maheswari Natarajan, Raghuram Bharadwaj DiddigiReinforcement LearningMeta-Learning

  8. Exposure-Based Reinforcement Learning to Rank

    Jul 21, 2026Harrie Oosterhuis, Rolf Jagerman, Zhen Qin +1Reinforcement LearningLearning to Rank

  9. The Open Ant: A Robot Platform for Reinforcement Learning Research

    Jul 20, 2026Elena Sorina Lupu, Patrick Spieler, Khurram Javed +4Reinforcement LearningRobotics Simulation

  10. RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

    Jul 20, 2026Yuxin Xiong, Xunyi Jiang, Rohan Surana +8Reinforcement LearningRL for Language Model Reasoning

  11. Neuro-Symbolic Meta-Policies for Temporal Knowledge-Graph Memory under Partial Observability

    Jul 20, 2026Taewoon Kim, Vincent François-Lavet, Michael CochezReinforcement LearningPartially Observable RL

  12. Towards Torque-Driven Reinforcement Learning for Quadruped Locomotion

    Jul 20, 2026Jordan Dowdy, Jean Chagas VazReinforcement LearningTerrain-Aware Robot Locomotion

  13. LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

    Jul 20, 2026Tianzhu Ye, Li Dong, Guanheng Chen +4Reinforcement LearningRubric-Based RL

  14. PRIME: Plasticity Recovery in Multi-Agent Environments for UAV-Assisted Emergency Communication Networks

    Jul 20, 2026Wen Qiu, Zhiqiang He, Wei Zhao +1Non-Stationary RLReinforcement Learning

  15. Theoretical Foundations of max⁡\max@kk Reinforcement Learning

    Jul 20, 2026Riccardo Poiani, Martino Bernasconi, Andrea CelliReinforcement LearningPolicy Learning

  16. Reinforcement Learning: From Algorithms To Foundation Models

    Jul 20, 2026Zihan DingReinforcement LearningRL for Video Generation

  17. TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning

    Jul 20, 2026Bin Han, Robert Wolfe, Bill HoweRemote Sensing Image UnderstandingReinforcement Learning

  18. TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

    Jul 19, 2026Yuhan Zhu, Changlian Ma, Xiangyu Zeng +12Temporal Video GroundingReinforcement Learning

  19. Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints

    Jul 19, 2026Hany Hamed, Abhishek Naik, Colin Bellinger +1Domain RandomizationReinforcement Learning

  20. Scalable Causal Imitation Learning

    Jul 18, 2026Eylam Tagor, Mingxuan Li, Elias BareinboimReinforcement LearningImitation Learning

  21. Enhancing Personalized Bladder Cancer Treatment Through Reinforcement Learning: A Recurrent Patient State Transition Decision Support Framework

    Jul 18, 2026Divyansh Chawla, Anshu Garg, Isshaan SinghReinforcement LearningHealthcare

  22. Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators

    Jul 18, 2026Alireza Furutanpey, Schahram DustdarFree Energy CalculationIntrinsic Reward Methods

  23. From Optimal Policies to Individual Differences: Rethinking Reinforcement Learning for Biology

    Jul 17, 2026Patrick Govoni, Palina Bartashevich, Clémence Bergerot +3Reinforcement Learning

  24. Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

    Jul 17, 2026Vincent Taboga, Justin Veilleux, Doseok Jang +2RL BenchmarksReinforcement Learning

  25. Differentiable Reinforcement Learning for Path Tracking by an Agile Fish-Like Robot

    Jul 17, 2026Prashanth Chivkula, Kartik Loya, Venkata Ravindhra Reddy Varikuti +1Robotic ControlRL Control

  26. Physics-enhanced reinforcement learning for real-time optimal control of dynamical systems

    Jul 17, 2026Matteo Tomasetto, Nicolò Botteghi, Gabriele Bruni +1RL ControlReinforcement Learning