RL Exploration

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 325% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 139

All topics
CardsList
  1. Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

    Jan 29, 2026Lei Yang, Wei Bi, Chenxi Sun +2RL for Language Model ReasoningRL Exploration

  2. Tracking Drift: Variation-Aware Entropy Scheduling for Non-Stationary Reinforcement Learning

    Jan 27, 2026Tongxi Wang, Zhuoyang Xia, Xinran Chen +1Non-Stationary RLSequential Decision Making

  3. R2^2PO: Decoupling Rollout and Inference Policies for LLM Reasoning

    Jan 17, 2026Jingchu Wang, Bingbing Xu, Yige Yuan +4RL for Language Model ReasoningPolicy Optimization

  4. Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory

    Dec 8, 2025Sijia Li, Yuchen Huang, Zifan Liu +6RL ExplorationGraph-Based Agent Memory

  5. Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

    Oct 16, 2025Shiqi Chen, Tongyao Zhu, Zian Wang +8RL ExplorationPolicy Learning

  6. Representation-Based Exploration for Language Models: From Test-Time to Post-Training

    Oct 13, 2025Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy +1RL for Language Model ReasoningTest-Time Scaling

  7. A Primer on SO(3) Action Representations in Deep Reinforcement Learning

    Oct 13, 2025Martin Schuck, Sherif Samy, Angela P. SchoelligRobotic RLRL Exploration

  8. Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

    Oct 5, 2025Zishang Jiang, Jinyi Han, Tingyun Li +7RL for Language Model ReasoningLLM-Guided RL

  9. Self-Supervised Goal-Reaching Results in Multi-Agent Cooperation and Exploration

    Sep 12, 2025Chirayu Nimonkar, Shlok Shah, Catherine Ji +1Multi-Agent CoordinationRL Exploration

  10. A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

    Apr 16, 2025Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis +1Reward ShapingMobile Robotics

  11. An Real-Sim-Real (RSR) Loop Framework for Generalizable Robotic Policy Transfer

    Mar 13, 2025Yuxuan Xu, Shiyu Wang, Jinhao Huang +6Robotic Data CollectionSim-to-Real Transfer

  12. ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy

    Dec 5, 2024Hongming Li, Zhao Yang, Xiaoxuan Liang +2Intrinsic Reward MethodsReinforcement Learning

  13. Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

    Oct 4, 2024Max Weltevrede, Caroline Horsch, Matthijs T. J. Spaan +1Reinforcement LearningRL Exploration

  14. Adaptive teachers for amortized samplers

    Oct 2, 2024Minsu Kim, Sanghyeok Choi, Taeyoung Yun +7Amortized InferenceRL Exploration

  15. Active Exploration via Autoregressive Generation of Missing Data

    May 29, 2024Tiffany Tianhui Cai, Hongseok Namkoong, Daniel Russo +1RL ExplorationAutoregressive Generation

  16. Partial GFlowNet: Accelerating Convergence in Large State Spaces via Strategic Partitioning

    Date pendingXuan Yu, Xu Wang, Rui Zhu +2Reinforcement LearningGenerative Flow Networks

  17. PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

    Date pendingHan Wang, Zijun Wang, Shuoshuo Xue +4World Model LearningWorld Models

  18. Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents

    Date pendingZhizhao Guan, Chen Huang, Ziming Liu +5RL ExplorationLLM Agents