RL Exploration

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 325% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 139

All topics
CardsList
  1. Information-Based Exploration via Random Features for Reinforcement Learning

    Jul 20, 2026Waris Radji, Odalric-Ambrym MaillardRL Exploration

  2. Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning

    Jul 19, 2026Joseph Lazzaro, Alessio Russo, Aldo PacchianoMarkov Decision ProcessesRL Exploration

  3. When Can Safe Controllers Adapt? Information before Commitment

    Jul 18, 2026Venkatesh SaligramaRL ExplorationOptimal Control

  4. Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators

    Jul 18, 2026Alireza Furutanpey, Schahram DustdarFree Energy CalculationIntrinsic Reward Methods

  5. Process Reward Informed Tree Rollout for Effective Multi-Turn RL

    Jul 17, 2026Xintong Li, Sha Li, Yuwei Zhang +8Reinforcement LearningRL Exploration

  6. ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

    Jul 14, 2026Yilun Kong, Yunpeng Qing, Guozheng Ma +4RL ExplorationRobotic Manipulation

  7. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    Jul 11, 2026Zhicheng Cai, Xinyuan Guo, Hanlin Wu +3Reinforcement LearningRL for Language Model Reasoning

  8. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6LLM-Guided RLRL Exploration

  9. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Jul 8, 2026Chongyu Fan, Pengfei Liu, Jingjia Huang +2RL for Language Model ReasoningPolicy Optimization

  10. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10RL for Language Model ReasoningLLM-Guided RL

  11. Exploration and Online Transfer with Behavioral Foundation Models

    Jun 29, 2026Louis Bagot, Mathieu Lefort, Laëtitia MatignonReinforcement LearningRL Exploration

  12. Dual-Flow Reinforcement Learning with State-Aware Exploration

    Jun 29, 2026Qijun Li, Zheng Fu, Qi Song +4Distributional RLReinforcement Learning

  13. Implementation of reinforcement learning in chemical reaction networks: application to phototaxis as curiosity-driven exploration

    Jun 24, 2026Ruyi Tang, Grégoire Sergeant-Perthuis, David ColliauxDynamical SystemsReinforcement Learning

  14. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL

  15. Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

    Jun 19, 2026Marco Pratticò, Pietro Novelli, Massimiliano Pontil +1Reinforcement LearningExploration-Exploitation Tradeoff

  16. Reward as An Agent for Embodied World Models

    Jun 18, 2026Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking

  17. DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

    Jun 17, 2026Calvin Luo, Chen Sun, Shuran SongRobot Policy AdaptationRobotic RL

  18. Can In-Context Learning Support Intrinsic Curiosity?

    Jun 17, 2026Eric Elmoznino, Sangnie Bhardwaj, Johannes von Oswald +5Intrinsic Reward MethodsIntrinsic Motivation

  19. UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

    Jun 17, 2026Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang +1Pairwise Preference EvaluationRL Exploration

  20. Infant Spontaneous Movement Noise Improves Exploration in Deep RL

    Jun 15, 2026Francisco M. López, Markus R. Ernst, Francisco Cruz +2Reinforcement LearningRL Exploration

  21. Repeated Bilateral Trade: The Quest for Fairness

    Jun 13, 2026François Bachoc, Roberto Colomboni, Emilie KaufmannMechanism DesignAlgorithmic Fairness

  22. Exploring Starts Are Not Enough: Counterexamples and a Fix for Monte Carlo Exploring Starts

    Jun 13, 2026Octave Oliviers, Glenn VinnicombeRL ControlReinforcement Learning

  23. VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

    Jun 12, 2026Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy +1Diffusion-Based PlanningRobot Navigation

  24. Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

    Jun 9, 2026Jiangnan Xia, Yucheng Shi, Yu Yang +3Memorization in Language ModelsRL for Language Model Reasoning

  25. SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration

    Jun 8, 2026Kaustubh Mani, Yann Pequignot, Vincent Mai +1Sharpness-Aware MinimizationRL Exploration

  26. Retry Policy Gradients in Continuous Action Spaces

    Jun 4, 2026Soichiro Nishimori, Paavo ParmasPolicy OptimizationRL Exploration