Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning

    May 24, 2026Yu Yang, Yihong Guo, Anqi Liu +1Diffusion Model GuidanceReinforcement Learning

  2. A Contractive Feedback Semantics for Reinforcement Learning

    May 23, 2026Zuyuan ZhangReinforcement Learning

  3. Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality

    May 23, 2026Amogh Palasamudram, Jakub Svoboda, Suguman Bansal +1Markov Decision ProcessesReinforcement Learning

  4. Streaming Reinforcement Learning under Partial Observability with Real-Time Recurrent Learning

    May 23, 2026Noah Farr, Aryaman Reddi, Carlo D'Eramo +1Reinforcement LearningPartially Observable RL

  5. RL with Learnable Textual Feedback: A Bilevel Approach

    May 23, 2026Utsav Singh, Sidhaarth Sredharan, Souradip Chakraborty +1Reinforcement LearningRL for Language Model Reasoning

  6. Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

    May 23, 2026Yuheng Jing, Kai Li, Ziwen Zhang +8RL BenchmarksMulti-Agent Coordination

  7. Refined Analysis of Entropy-Regularized Actor-Critic

    May 23, 2026Safwan Labbi, Paul Mangold, Daniil Tiapkin +1Reinforcement LearningMaximum Entropy RL

  8. Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs

    May 23, 2026Meichen Song, Yuhao Wang, Enlu ZhouReinforcement LearningBayesian RL

  9. Concept Drift Adaptation Using Self-Supervised and Reinforcement Learning In Android Malware Detection

    May 22, 2026Ahmed Sabbah, Mohammad Kharma, Mohammad Alkhanafseh +3Reinforcement LearningConcept Drift

  10. Geo-Align: Video Generation Alignment via Metric Geometry Reward

    May 22, 2026Zizun Li, Haoyu Guo, Runzhe Teng +2Camera-Controlled Video GenerationReinforcement Learning

  11. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  12. Less Effort, Shorter Proofs: Reinforcement Learning for Security Protocol Analysis in Tamarin

    May 22, 2026Matthias Cosler, Cas Cremers, Bernd Finkbeiner +2Reinforcement LearningAutomated Theorem Proving

  13. Understanding Goal Generalisation in Sequential Reinforcement Learning

    May 22, 2026Jason Ross Brown, Edward James YoungReinforcement LearningOOD Generalization

  14. B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

    May 22, 2026Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi +2Image SegmentationReinforcement Learning

  15. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning

  16. Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control

    May 22, 2026Shuai Zhen, Yifan Zhang, Yuling Wang +1RL ControlReinforcement Learning

  17. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  18. Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback

    May 22, 2026Zitian Li, Wang Chi CheungReinforcement LearningRL Exploration

  19. Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

    May 22, 2026Manish Aryal, Faiyaz Azam, Agnivo Banerjee +11Reinforcement LearningModel Misspecification

  20. Vector Policy Optimization: Training for Diversity Improves Test-Time Search

    May 21, 2026Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld +6Multi-Objective Reinforcement LearningReinforcement Learning

  21. Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

    May 21, 2026Lily Goli, Justin Kerr, Daniele Reda +3Reinforcement LearningEmbodied Navigation

  22. Deep Reinforcement Learning for Flexible Job Shop Scheduling with Random Job Arrivals

    May 21, 2026Yu Tang, Muhammad Zakwan, Efe Balta +2Reinforcement LearningCombinatorial Optimization

  23. Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

    May 21, 2026Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash +2Multi-Objective Reinforcement LearningIntrinsic Reward Methods

  24. LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

    May 21, 2026Yuchun Fan, Bei Li, Peiguang Li +9Multilingual Language ModelsReinforcement Learning

  25. Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning

    May 21, 2026Benjamin Poole, Andrew Quinn, Li Yang +1Reinforcement LearningDeep Q-Learning

  26. Long-term Fairness with Selective Labels

    May 21, 2026Giovani Valdrighi, Isabel Valera, Marcos Medeiros RaimundoReinforcement LearningAlgorithmic Fairness

  27. Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

    May 21, 2026Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu +4Reinforcement LearningSelf-Play RL