RL Exploration

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 325% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 139

All topics
CardsList
  1. Decoupling Exploration from Optimization in RLVR

    Oct 7, 2026Saif Punjwani, Micah GoldblumRL for Language Model ReasoningRL Exploration

  2. Constraint Tree Exploration for Learning from Language Feedback

    Oct 6, 2026Shaoang Li, Daniel R. Jiang, Jian LiRL ExplorationRL from Human Feedback

  3. When Do Intrinsic Rewards Lead to Exploration?

    Oct 1, 2026Scott W. Viteri, Laura Gomezjurado Gonzalez, Clark BarrettIntrinsic Reward MethodsRL Exploration

  4. ExploreNet: Learning Where to Explore in Diffusion GRPO

    Sep 29, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Diffusion Model Fine-TuningRL Exploration

  5. Human-inspired, Task-Dimension-Guided Exploration for Efficient Learning in High Dimensions

    Sep 29, 2026Fanyu Zhu, Jiahui An, Ni JiExploration-Exploitation TradeoffRL Exploration

  6. Deep Epistemic Value Functions for Optimistic Exploration

    Sep 28, 2026Leander Diaz-Bone, Marco Bagatella, Jonas Hübotter +1Value Function EstimationRL Exploration

  7. ICMAPE: In-Context Multiagent Pure Exploration

    Sep 27, 2026Xinyi Hu, Alessio Russo, Aldo PacchianoRL ExplorationDecentralized MARL

  8. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4RL for Language ModelsRL for Language Model Reasoning

  9. Beyond Conservatism: Recoverability-Conditioned Exploration for Model-Based Imitation Learning

    Sep 27, 2026Xuanlin Chen, Ziyue Wang, Xunlan Zhou +3Imitation LearningRL Exploration

  10. AlphaDiverse: Post-Training Local Quantitative Research Agents for Diverse Exploration in Alpha Factor Mining

    Sep 24, 2026Qingzhuo Wang, Zikun Wei, Zhihua Wei +1Multi-Agent LLM SystemsQuantitative Finance

  11. Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy

    Sep 23, 2026Mehmet Turan Yardımcı, Yunus Emre ÇoğurcuRobot Policy LearningRL Exploration

  12. Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

    Sep 17, 2026Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan +2Supervised Fine-TuningReinforcement Learning

  13. Learning to Solve Stochastic Controls with Unknown Drifts and Running Rewards: Theory, Algorithms and Convergence

    Sep 14, 2026Jin Ma, Gaozhan Wang, Jianfeng Zhang +1Reinforcement LearningStochastic Optimal Control

  14. Dream-RSI: Recursive Self-Improvement through Evolving Worlds

    Sep 14, 2026Tong Zheng, Xidong Wu, Zheng Zhang +14RL ExplorationSelf-Improving Agents

  15. Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR

    Sep 8, 2026Youngjun Yu, Sanghwan Jang, Hwanjo YuRL for Language Model ReasoningRL Exploration

  16. SUN: Reaching for Novelty in Reinforcement Learning

    Sep 8, 2026Wenyan Yang, Arsenii Mustafin, Dominik Baumann +2Intrinsic MotivationRL Exploration

  17. Efficient Exploration Is Enough

    Sep 7, 2026Mikel Malagón, Jon Vadillo, Josu Ceberio +2Intrinsic Reward MethodsRL Exploration

  18. CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments

    Aug 31, 2026Junhee Lee, Seunghwan Kim, Hongro Jang +4RL ExplorationRobust RL

  19. Exploration-Driven Personalized Federated Reinforcement Learning via Intrinsic Motivation

    Aug 11, 2026Md Rafid Islam, Rafsan Jany, Zahid Hasan +1Federated RLIntrinsic Motivation

  20. Parameter Exploration for RLVR via Variational Learning

    Aug 10, 2026Vatsal Venkatkrishna, Nico Daheim, Iryna GurevychRL for Language Model ReasoningRL Exploration

  21. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

    Aug 10, 2026Jinkun Hou, Zhuo Liu, Huimin Ren +3Open-Ended GenerationRL for Language Models

  22. Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning

    Aug 5, 2026Jai Malegaonkar, Rohan Patil, Henrik I. ChristensenReinforcement LearningPartially Observable RL

  23. Explore Beyond the Boundary Using Entropic Information

    Jul 31, 2026Bumgeun Park, Donghwan LeeReinforcement LearningRL Exploration

  24. WARL: Wrench-Augmented Reinforcement Learning for Task-Agnostic Learning in Legged Robots

    Jul 27, 2026Keita Yoneda, Kento Kawaharazuka, Kei OkadaCurriculum RLRL Exploration

  25. Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

    Jul 26, 2026Haizhou Ge, Haochen Ouyang, Zhixing Chen +6RL ExplorationRobotic Manipulation

  26. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

    Jul 22, 2026Kaibing Yang, Guangfeng Cai, Shengtian Yang +6Group Relative Policy OptimizationRL Exploration

  27. Information-Based Exploration via Random Features for Reinforcement Learning

    Jul 20, 2026Waris Radji, Odalric-Ambrym MaillardRL Exploration

  28. Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning

    Jul 19, 2026Joseph Lazzaro, Alessio Russo, Aldo PacchianoMarkov Decision ProcessesRL Exploration

  29. When Can Safe Controllers Adapt? Information before Commitment

    Jul 18, 2026Venkatesh SaligramaRL ExplorationOptimal Control

  30. Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators

    Jul 18, 2026Alireza Furutanpey, Schahram DustdarFree Energy CalculationIntrinsic Reward Methods

  31. Process Reward Informed Tree Rollout for Effective Multi-Turn RL

    Jul 17, 2026Xintong Li, Sha Li, Yuwei Zhang +8Reinforcement LearningRL Exploration

  32. ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

    Jul 14, 2026Yilun Kong, Yunpeng Qing, Guozheng Ma +4RL ExplorationRobotic Manipulation

  33. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    Jul 11, 2026Zhicheng Cai, Xinyuan Guo, Hanlin Wu +4Reinforcement LearningRL for Language Model Reasoning

  34. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6LLM-Guided RLRL Exploration

  35. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Jul 8, 2026Chongyu Fan, Pengfei Liu, Jingjia Huang +2RL for Language Model ReasoningPolicy Optimization

  36. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10RL for Language Model ReasoningLLM-Guided RL

  37. Exploration and Online Transfer with Behavioral Foundation Models

    Jun 29, 2026Louis Bagot, Mathieu Lefort, Laëtitia MatignonReinforcement LearningRL Exploration

  38. Dual-Flow Reinforcement Learning with State-Aware Exploration

    Jun 29, 2026Qijun Li, Zheng Fu, Qi Song +4Distributional RLReinforcement Learning

  39. Implementation of reinforcement learning in chemical reaction networks: application to phototaxis as curiosity-driven exploration

    Jun 24, 2026Ruyi Tang, Grégoire Sergeant-Perthuis, David ColliauxDynamical SystemsReinforcement Learning

  40. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL

  41. Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

    Jun 19, 2026Marco Pratticò, Pietro Novelli, Massimiliano Pontil +1Reinforcement LearningExploration-Exploitation Tradeoff

  42. Reward as An Agent for Embodied World Models

    Jun 18, 2026Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking

  43. DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

    Jun 17, 2026Calvin Luo, Chen Sun, Shuran SongRobot Policy AdaptationRobotic RL

  44. Can In-Context Learning Support Intrinsic Curiosity?

    Jun 17, 2026Eric Elmoznino, Sangnie Bhardwaj, Johannes von Oswald +5Intrinsic Reward MethodsIntrinsic Motivation

  45. UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

    Jun 17, 2026Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang +1Pairwise Preference EvaluationRL Exploration

  46. Infant Spontaneous Movement Noise Improves Exploration in Deep RL

    Jun 15, 2026Francisco M. López, Markus R. Ernst, Francisco Cruz +2Reinforcement LearningRL Exploration

  47. Repeated Bilateral Trade: The Quest for Fairness

    Jun 13, 2026François Bachoc, Roberto Colomboni, Emilie KaufmannMechanism DesignAlgorithmic Fairness

  48. Exploring Starts Are Not Enough: Counterexamples and a Fix for Monte Carlo Exploring Starts

    Jun 13, 2026Octave Oliviers, Glenn VinnicombeRL ControlReinforcement Learning

  49. VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

    Jun 12, 2026Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy +1Diffusion-Based PlanningRobot Navigation

  50. Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

    Jun 9, 2026Jiangnan Xia, Yucheng Shi, Yu Yang +3Memorization in Language ModelsRL for Language Model Reasoning

  51. SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration

    Jun 8, 2026Kaustubh Mani, Yann Pequignot, Vincent Mai +1Sharpness-Aware MinimizationRL Exploration

  52. Retry Policy Gradients in Continuous Action Spaces

    Jun 4, 2026Soichiro Nishimori, Paavo ParmasPolicy OptimizationRL Exploration