RL Exploration

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 325% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 140

All topics
CardsList
  1. Retry Policy Gradients in Continuous Action Spaces

    Jun 4, 2026Soichiro Nishimori, Paavo ParmasPolicy OptimizationRL Exploration

  2. Easy-to-Use Shielding for Reinforcement Learning

    Jun 2, 2026Stefan Pranger, Bettina KönighoferReinforcement LearningRL Exploration

  3. Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

    Jun 2, 2026Hongye Cao, Nuo Yan, Haoyuan Deng +5Agentic RLRL for Language Model Reasoning

  4. Constraint-Enhanced Physical Search through Correlation Matching

    Jun 2, 2026Song-Ju KimMulti-Armed BanditsRL Exploration

  5. Randomized Least Squares Value Iteration itself is Joint Differentially Private

    Jun 1, 2026Haiyang Lu, Pratik Gajane, Shaojie Bai +1Markov Decision ProcessesRL Exploration

  6. Joint Agent Memory and Exploration Learning via Novelty Signals

    Jun 1, 2026Shizuo Tian, Xiaohong Weng, Rui Kong +9RL ExplorationMemory-Augmented Language Model Agents

  7. Efficient Exploration for Iterative Nash Preference Optimization

    May 31, 2026Tianlong Nan, Xiaopeng Li, Christian Kroer +1Nash EquilibriumLLM Alignment

  8. Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying

    May 29, 2026Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada +4RL ExplorationPolicy Gradient Methods

  9. Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

    May 28, 2026Ahmed Abouelazm, Felix Klingebiel, Philip Schörner +1Reinforcement LearningRisk-Sensitive RL

  10. Information-Directed Offline-to-Online Reinforcement Learning

    May 28, 2026Keru ChenRegret Minimization in RLBayesian RL

  11. Exploratory Experience Shapes the Geometry of Predictive Representations

    May 27, 2026Kseniia Shilova, Abdelrahman Sharafeldin, Advay Balakrishnan +1Computational Cognitive ModelingPredictive Coding

  12. Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty

    May 26, 2026Chayan Banerjee, Ethan GoanActive PerceptionConstrained RL

  13. Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs

    May 23, 2026Meichen Song, Yuhao Wang, Enlu ZhouReinforcement LearningBayesian RL

  14. Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback

    May 22, 2026Zitian Li, Wang Chi CheungReinforcement LearningRL Exploration

  15. Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

    May 21, 2026Lily Goli, Justin Kerr, Daniele Reda +3Reinforcement LearningEmbodied Navigation

  16. Kernel-Based Safe Exploration in Deep Reinforcement Learning

    May 21, 2026Rupak Majumdar, Nikhil Singh, Sadegh SoudjaniControl Barrier FunctionsRL Exploration

  17. Mind the Sim-to-Real Gap & Think Like a Scientist

    May 20, 2026Harsh Parikh, Gabriel Levin-Konigsberg, Dominique Perrault-Joncas +1Sim-to-Real TransferRL Exploration

  18. CIG: Exploration via Conditional Information Gain

    May 20, 2026Tim Joseph, Marcus Fechner, Philipp Stegmaier +2Intrinsic Reward MethodsIntrinsic Motivation

  19. A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

    May 19, 2026Andreas Triantafyllopoulos, Jakub Šťastný, Alexios Terpinas +3Reinforcement LearningIntrinsic Motivation

  20. JAXenstein: Accelerated Benchmarking for First-Person Environments

    May 19, 2026Ruo Yu Tao, George KonidarisRL BenchmarksPartially Observable RL

  21. Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

    May 19, 2026Xiaozhe Li, Yang Li, Xinyu Fang +10KL-Regularized RLRL for Language Model Reasoning

  22. Generative Auto-Bidding with Unified Modeling and Exploration

    May 19, 2026Mingming Zhang, Feiqing Zhuang, Na Li +7Automated BiddingOnline Advertising

  23. FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

    May 18, 2026Xikai Zhang, Yongzhi Li, Likang Xiao +6RL for Language Model ReasoningRL Exploration

  24. Look Before You Leap: Autonomous Exploration for LLM Agents

    May 15, 2026Ziang Ye, Wentao Shi, Yuxin Liu +6RL ExplorationLLM Agents

  25. Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds

    May 15, 2026Shaojun Xu, Xiaoling Zhou, Yihan Lin +4Reinforcement LearningCredit Assignment in RL

  26. Data-Augmented Game Starts for Accelerating Self-Play Exploration in Imperfect Information Games

    May 14, 2026JB Lanier, Nathan Monette, Pierre Baldi +1RL BenchmarksSelf-Play RL