Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

    Oct 10, 2025Xinyi Wang, Jinyi Han, Zishang Jiang +7Reinforcement LearningRL for Language Model Reasoning

  2. The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

    Oct 7, 2025Matthieu Bou, Nyal Patel, Arjun Jagota +2Reinforcement LearningLLM Auditing

  3. Octax: Accelerated CHIP-8 Arcade Environments for Reinforcement Learning in JAX

    Oct 2, 2025Waris Radji, Thomas Michel, Hector PiteauRL BenchmarksReinforcement Learning

  4. Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

    Oct 1, 2025Xin-Qiang Cai, Wei Wang, Feng Liu +3Reinforcement LearningRL for Language Model Reasoning

  5. Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation

    Sep 24, 2025Raphael Simon, Pieter Libin, Wim MeesReinforcement LearningPartially Observable RL

  6. Frictional Q-Learning

    Sep 24, 2025Hyunwoo Kim, Hyo Kyung LeeReinforcement LearningQ-Learning

  7. Tackling GNARLy Problems: Graph Neural Algorithmic Reasoning Reimagined through Reinforcement Learning

    Sep 23, 2025Alex Schutz, Victor-Alexandru Darvariu, Efimia Panagiotaki +2Graph Neural NetworksReinforcement Learning

  8. ICR-RL: Deep Reinforcement Learning via In-Context Regression

    Sep 14, 2025David Schiff, Ofir Lindenbaum, Yonathan EfroniReinforcement LearningIn-Context Learning

  9. Reward function compression facilitates goal-dependent reinforcement learning

    Sep 8, 2025Gaia Molinaro, Anne G. E. CollinsReinforcement LearningGoal-Conditioned RL

  10. Learning Acrobatic Flight from Preferences

    Aug 26, 2025Colin Merk, Ismail Geles, Jiaxu Xing +3RL for RoboticsAerial Robotics

  11. Hybrid Sequence Modeling and Reinforced Verification for Controllable Target-Conditioned Decision Making

    Aug 22, 2025Yue Pei, Hongming Zhang, Chao Gao +7Reinforcement LearningOffline RL

  12. Distributionally Robust Markov Games with Average Reward

    Aug 5, 2025Zachary Roch, Yue WangNash EquilibriumMulti-Agent System Optimization

  13. Illuminating the Three Dogmas of Reinforcement Learning under Evolutionary Light

    Jul 15, 2025Mani Hamidi, Terrence W. DeaconReinforcement LearningNovelty Search

  14. Policy Improvement with Style-Specific Demonstrations

    Jun 20, 2025Lingfeng Li, Yunlong Lu, Yongyi Wang +1Reinforcement LearningGame-Playing Agents

  15. Adaptive Reinforcement Learning for Unobservable Random Delays

    Jun 17, 2025John Wikman, Alexandre Proutiere, David BromanReinforcement LearningRobotic RL

  16. Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control

    Jun 10, 2025Laurens Engwegen, Max Weltevrede, Caroline Horsch +2Robotic ControlReinforcement Learning

  17. Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning

    Jun 8, 2025Yang Xu, Swetha Ganesh, Vaneet AggarwalRobust Markov Decision ProcessesReinforcement Learning

  18. MAGIK: Mapping to Analogous Goals via Imagination-enabled Knowledge Transfer

    Jun 2, 2025Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu RanaReinforcement LearningTransfer Learning

  19. Agentic Episodic Control

    Jun 2, 2025Xidong Yang, Wenhao Li, Junjie Sheng +4Agentic RLReinforcement Learning

  20. Normalizing Flows are Capable Models for Continuous Control

    May 29, 2025Raj Ghugare, Benjamin EysenbachNormalizing FlowsReinforcement Learning

  21. Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis

    May 18, 2025Zachary Roch, George Atia, Yue WangReinforcement LearningAverage-Reward RL

  22. Adaptive Resolving Methods for Markov Decision Processes with Function Approximations

    May 17, 2025Jiashuo Jiang, Yinyu Ye, Yiming ZongMarkov Decision ProcessesReinforcement Learning

  23. Towards More Efficient, Robust, Instance-adaptive, and Generalizable Sequential Decision making

    Apr 12, 2025Zhiyong WangMulti-Armed BanditsReinforcement Learning

  24. CONTHER: Context-Aware Reinforcement Learning for Robotic Manipulation with Sparse Rewards

    Mar 20, 2025Maria Makarova, Qian Liu, Dzmitry TsetserukouReinforcement LearningExperience Replay

  25. 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities

    Mar 19, 2025Kevin Wang, Ishaan Javali, Michał Bortkiewicz +2Reinforcement LearningRobotic RL

  26. Supervised Reward Inference

    Feb 25, 2025Will Schwarzer, Jordan Schneider, Philip S. Thomas +1Reward ModelingReinforcement Learning

  27. Compositional Concept-Based Neuron-Level Interpretability for Deep Reinforcement Learning

    Feb 2, 2025Zeyu Jiang, Hai Huang, Xingquan ZuoReinforcement LearningConcept-Based Explanations

  28. ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy

    Dec 5, 2024Hongming Li, Zhao Yang, Xiaoxuan Liang +2Intrinsic Reward MethodsReinforcement Learning

  29. Reinforcement learning for Quantum Tiq-Taq-Toe

    Nov 10, 2024Catalin-Viorel Dinu, Thomas MoerlandReinforcement LearningGame-Playing Agents

  30. RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner

    Oct 31, 2024Fu-Chieh Chang, Yu-Ting Lee, Hui-Ying Shih +2Reinforcement LearningRL for Language Model Reasoning

  31. Streaming Deep Reinforcement Learning Finally Works

    Oct 18, 2024Mohamed Elsayed, Elena Sorina Lupu, Gautham Vasan +1Reinforcement LearningActor-Critic Methods

  32. Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

    Oct 4, 2024Max Weltevrede, Caroline Horsch, Matthijs T. J. Spaan +1Reinforcement LearningRL Exploration

  33. Deep Reinforcement Learning for Reach-Avoid-Stay Problems

    Oct 3, 2024Gabriel Chenevert, Jingqi Li, Achyuta kannan +2Robust ControlReinforcement Learning

  34. Exploiting Exogenous Structure for Sample-Efficient Reinforcement Learning

    Sep 22, 2024Jia Wan, Sean R. Sinclair, Devavrat Shah +1Regret Minimization in RLMarkov Decision Processes

  35. Mitigating the Stability-Plasticity Dilemma in Adaptive Train Scheduling with Curriculum-Driven Continual DQN Expansion

    Aug 19, 2024Achref Jaziri, Etienne Künzel, Visvanathan RameshStability-Plasticity DilemmaNon-Stationary RL

  36. Training Verifiably Robust Agents Using Set-Based Reinforcement Learning

    Aug 17, 2024Manuel Wendl, Lukas Koller, Tobias Ladner +1RL ControlReinforcement Learning

  37. ProSpec RL: Plan Ahead, then Execute

    Jul 31, 2024Liangliang Liu, Yi Guan, BoRan Wang +5Reinforcement LearningRisk-Sensitive RL

  38. Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms

    Jul 21, 2024Sheila Schoepp, Mehran Taghian, Shotaro Miwa +3RL ControlReinforcement Learning

  39. Thompson Sampling for Infinite-Horizon Discounted Decision Processes

    May 14, 2024Daniel Adelman, Cagla Keceli, Alba V. Olivares-NadalThompson SamplingRegret Minimization in RL

  40. TERC: A Transfer Entropy Redundancy Criterion for State Variable Selection in Reinforcement Learning

    Jan 21, 2024Charles Westphal, Stephen Hailes, Mirco MusolesiReinforcement LearningState Representation Learning

  41. JaxMARL: Multi-Agent RL Environments and Algorithms in JAX

    Nov 16, 2023Alexander Rutherford, Benjamin Ellis, Matteo Gallici +18RL BenchmarksReinforcement Learning

  42. Bridging the Gap between Newton-Raphson Method and Regularized Policy Iteration

    Oct 11, 2023Zeyang Li, Chuxiong Hu, Yunan Wang +4Markov Decision ProcessesReinforcement Learning

  43. Robust Recurrent Reinforcement Learning under Evolving Hidden Disturbances with Application to Rover Wheel Slip

    Jul 29, 2023Saki Omi, Hyo-Sang Shin, Namhoon Cho +2RL for RoboticsReinforcement Learning

  44. ETHER: Aligning Emergent Communication for Hindsight Experience Replay

    Jul 28, 2023Kevin Yandoka Denamganaï, Daniel Hernandez, Ozan Vardal +2Reinforcement LearningExperience Replay

  45. Reinforcement Learning with Temporal-Logic-Based Causal Diagrams

    Jun 23, 2023Yash Paliwal, Rajarshi Roy, Jean-Raphaël Gaglione +5Reinforcement LearningCausal RL

  46. Topology-Guided Modular Actor-Critic Learning for Continuous Systems under Temporal Objectives

    Apr 20, 2023Lening Li, Zhentian Qian, Jianan Xia +7RL ControlReinforcement Learning

  47. Playing 20 Question Game with Policy-Based Reinforcement Learning

    Aug 23, 2018Huang Hu, Xianchao Wu, Bingfeng Luo +4Reinforcement LearningGame-Playing Agents

  48. Safe Learning Under Irreversible Dynamics via Asking for Help

    Date pendingBenjamin Plaut, Juan Liévano-Karim, Hanlin Zhu +1Regret Minimization in RLReinforcement Learning

  49. AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training

    Date pendingZhenyu Han, Ansheng You, Haibo Wang +16RL for Language ModelsAsynchronous RL

  50. UBCL: A Reinforcement Learning Framework for Controllable and Diverse Player Behaviors

    Date pendingAtahan Cilan, Atay ÖzgövdeReinforcement LearningHuman Behavior Simulation

  51. Partial GFlowNet: Accelerating Convergence in Large State Spaces via Strategic Partitioning

    Date pendingXuan Yu, Xu Wang, Rui Zhu +2Reinforcement LearningGenerative Flow Networks

  52. Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

    Date pendingZikang Shan, Han Zhong, Liwei Wang +1RL for Language ModelsReinforcement Learning

  53. Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

    Date pendingAnthony GX-Chen, Ankit Anand, Gheorghe Comanici +7Reinforcement LearningRL for Language Model Reasoning