Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Imitation Learning for Elder-Facing Speech Synthesis

    Jun 19, 2026Dongrui Han, Weidong Chen, Jiawen Kang +3Reinforcement LearningTTS Synthesis

  2. When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

    Jun 18, 2026Xiaolong Jin, Xuandong Zhao, Wenbo Guo +2RL for Code GenerationIntrinsic Reward Methods

  3. Evolutionary Discovery of Developmental Reward Schedules in Deep Reinforcement Learning

    Jun 18, 2026Alan Nadelsticher RuvalcabaReinforcement LearningSparse-Reward RL

  4. ReLaTS: a Reinforcement Learning-based method for dynamically determining the coupling Time Step in multi-scale simulations of self-gravitating systems

    Jun 18, 2026Veronica Saz Ulibarrena, Simon Portegies ZwartReinforcement LearningScientific ML

  5. CRAX: Fast Safe Reinforcement Learning Benchmarking

    Jun 18, 2026Tristan Tomilin, Mourad Boustani, Mickey Beurskens +2RL BenchmarksReinforcement Learning

  6. ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

    Jun 18, 2026Yuhan Liu, Pei Fu, Hang Li +8Reinforcement LearningMultimodal Large Language Models

  7. Augmenting Game AI with Deep Reinforcement Learning

    Jun 18, 2026Alessandro Sestini, Joakim Bergdahl, Amir Baghi +3Reinforcement LearningGame-Playing Agents

  8. Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random

    Jun 18, 2026Ziheng Wei, Annie Qu, Rui MiaoReinforcement LearningOff-Policy Evaluation

  9. MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments

    Jun 18, 2026Wei Yu, Suxing Liu, Minjie Yu +4Reinforcement LearningDeep Research Agents

  10. Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

    Jun 18, 2026Xuanzhi Feng, Zhengyang Li, Zeyu Liu +6Reinforcement LearningRL for Language Model Reasoning

  11. OnDeFog: Online Decision Transformer under Frame Dropping

    Jun 18, 2026Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu +2Reinforcement LearningTransformer

  12. Multi-Granular Attention-Driven Reinforcement Learning Framework for Web Intelligent Enhancement Systems

    Jun 18, 2026Navin Chhibber, Deepak Singh, Anokh Kishore +2Reinforcement LearningMulti-Agent Reinforcement Learning

  13. The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL

    Jun 17, 2026Nicolas Beltran-Velez, Felix Friedrich, Zhang Xiaofeng +4Flow MatchingReinforcement Learning

  14. Pareto Q-Learning with Reward Machines

    Jun 17, 2026Arnaud Lequen, Clément Legrand-Lixon, Léo SaulièresMulti-Objective Reinforcement LearningReinforcement Learning

  15. EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

    Jun 17, 2026Minseo Kim, Minjae Lee, Seunghyuk Oh +7RL for Language ModelsReinforcement Learning

  16. Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization

    Jun 17, 2026Lanqing Li, Shentong Mo, Yang Yu +1RL for Language ModelsReinforcement Learning

  17. GraphPO: Graph-based Policy Optimization for Reasoning Models

    Jun 17, 2026Yuliang Zhan, Xinyu Tang, Jian Li +7Reinforcement LearningLLM Reasoning with Graphs

  18. Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

    Jun 17, 2026Kinam Kim, Namiko Saito, Heecheol Kim +3Reinforcement LearningZero-Shot Robotic Manipulation

  19. Reinforcement Learning Foundation Models Should Already Be A Thing

    Jun 17, 2026Abdelrahman Zighem, Jill-Jênn VieSynthetic Data PretrainingReinforcement Learning

  20. Benchmarking Action Spaces in Reinforcement Learning for Vision-based Robotic Manipulation

    Jun 17, 2026Seyed Alireza Azimi, Homayoon Farrahi, Abhishek Naik +2RL for RoboticsReinforcement Learning

  21. Do as the Romans Do: Learning Universal Behaviors from Heterogeneous Agents

    Jun 16, 2026Caleb Chang, Davin Win Kyi, Natasha Jaques +1Reinforcement LearningImitation Learning

  22. Learning-Based Decision Making for Combustion Phasing Control in Multi-Fuel CI Engines with Latent Fuel Reactivity Estimation

    Jun 16, 2026Rajasree Sarkar, Aditya Satish Patil, Arunava Banerjee +4Reinforcement LearningPartially Observable RL

  23. LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

    Jun 16, 2026Haoyang Fang, Wei Zhu, Boran Han +11Reinforcement LearningLarge Language Model-Guided Optimization

  24. Deep Reinforcement Learning for Minimum Zero-Forcing Sets

    Jun 16, 2026Steve Halley, Maurício GruppiReinforcement LearningCombinatorial Optimization