RL Exploration

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 325% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 139

All topics
CardsList
  1. TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

    May 12, 2026Matthew M. Hong, Jesse Zhang, Anusha Nagabandi +1Robot Policy AdaptationRobot Skill Learning

  2. Learning What Matters: Adaptive Information-Theoretic Objectives for Robot Exploration

    May 12, 2026Youwei Yu, Jionghao Wang, Zhengming Yu +2Robotic Data CollectionRobot Navigation

  3. Epistemic Uncertainty for Test-Time Discovery

    May 11, 2026Kainat Riaz, Muhammad Ahmed Mohsin, Ahsan Bilal +5RL for Language ModelsRL Exploration

  4. Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

    May 9, 2026Xingyuan Hua, Sheng Yue, Ju RenRL for Language Model ReasoningTest-Time Scaling

  5. How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

    May 9, 2026Yifan Xu, Junren Chen, Yifan ChenRL for Language Model ReasoningPrompt Tuning

  6. Model-Driven Policy Optimization in Differentiable Simulators via Stochastic Exploration

    May 8, 2026Yuval Aroosh, Ayal TaitlerPolicy OptimizationRL Exploration

  7. Measuring Learning Progress via Gradient-Momentum Coupling

    May 7, 2026Samuel Blad, Martin Längkvist, Amy LoutfiReinforcement LearningIntrinsic Motivation

  8. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

    May 6, 2026Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang +2RL ExplorationSample-Efficient RL

  9. What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity

    May 5, 2026Haoxi Li, Qinglin Hou, Jianfei Ma +6Intrinsic MotivationRL Exploration

  10. T2^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning

    May 4, 2026Haixin Wang, Hejie Cui, Chenwei Zhang +7Agentic RLReinforcement Learning

  11. Quality-Aware Exploration Budget Allocation for Cooperative Multi-Agent Reinforcement Learning

    May 3, 2026Dahyun Oh, Minhyuk Yoon, H. Jin KimMulti-Agent CoordinationIntrinsic Reward Methods

  12. NonZero: Interaction-Guided Exploration for Multi-Agent Monte Carlo Tree Search

    May 1, 2026Sizhe Tang, Zuyuan Zhang, Mahdi Imani +1Multi-Agent System OptimizationMulti-Agent Coordination

  13. Exploration Hacking: Can LLMs Learn to Resist RL Training?

    Apr 30, 2026Eyon Jang, Damon Falck, Joschka Braun +6RL ExplorationLLM Safety

  14. Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?

    Apr 30, 2026Buqing Ou, Frederike DümbgenTabular Foundation ModelsRobot Policy Learning

  15. Safe-Support Q-Learning: Learning without Unsafe Exploration

    Apr 28, 2026Yeeun Lim, Narim Jeong, Donghwan LeeReinforcement LearningKL-Regularized RL

  16. Hierarchical Behaviour Spaces

    Apr 27, 2026Michael Tryfan Matthews, Anssi Kanervisto, Jakob Foerster +3Reinforcement LearningHierarchical RL

  17. DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

    Apr 27, 2026Junshuo Zhang, Chengrui Huang, Feng Guo +6Reinforcement LearningRL Exploration

  18. Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training

    Apr 20, 2026Vin Bhaskara, Haicheng WangIntrinsic Reward MethodsReinforcement Learning

  19. OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

    Apr 20, 2026Xinyu Ma, Mingzhou Xu, Xuebo Liu +4Reward ShapingRL for Language Model Reasoning

  20. HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

    Apr 20, 2026Zhanyu Liu, Qingguo Hu, Ante Wang +5RL for Language Model ReasoningFew-Shot Learning

  21. Poly-EPO: Training Exploratory Reasoning Models

    Apr 19, 2026Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam +5Reinforcement LearningRL for Language Model Reasoning

  22. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

    Apr 18, 2026Yifu Huo, Chenglong Wang, Ziming Zhu +9Reinforcement LearningRL for Language Model Reasoning

  23. Flexible Empowerment at Reasoning with Extended Best-of-N Sampling

    Apr 17, 2026Taisuke KobayashiReinforcement LearningBest-of-N Sampling

  24. Targeted Exploration via Unified Entropy Control for Reinforcement Learning

    Apr 16, 2026Chen Wang, Lai Wei, Yanzhi Zhang +5Reinforcement LearningRL for Language Model Reasoning

  25. ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

    Apr 3, 2026Zihao Sheng, Xin Ye, Jingru Luo +2World Model LearningVLMs for Autonomous Driving

  26. ContactExplorer: Contact Coverage-Guided Exploration for General-Purpose Dexterous Manipulation

    Mar 11, 2026Zixuan Liu, Ruoyi Qiao, Chenrui Tie +5Contact-Rich Robotic ManipulationRL Exploration

  27. Conformal Policy Control

    Mar 2, 2026Drew Prinster, Clara Fannjiang, Ji Won Park +4Constrained RLRL Exploration

  28. Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

    Feb 5, 2026Zhiqi Yu, Zhangquan Chen, Mengting Liu +2RL for Language Model ReasoningGroup Relative Policy Optimization