Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

    Jun 29, 2026Eric Peh, Debaditya Roy, Basura FernandoReinforcement LearningVisual Reasoning

  2. Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

    Jun 29, 2026Siyao Chen, Jiakang Yuan, Jiaxin Wang +1Intrinsic Reward MethodsReinforcement Learning

  3. RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning

    Jun 29, 2026Adithya Mohan, Daniel Kriegl, Torsten SchönRL BenchmarksReinforcement Learning

  4. Dual-Flow Reinforcement Learning with State-Aware Exploration

    Jun 29, 2026Qijun Li, Zheng Fu, Qi Song +4Distributional RLReinforcement Learning

  5. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement LearningRL for Language Model Reasoning

  6. Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

    Jun 28, 2026Chao Wang, Hongtao Tian, Tao Yang +3Reinforcement LearningProcess Reward Models

  7. CORE Planner: Contextual-memory Oriented Reinforcement-learning in Unknown Environments for Robot Navigation

    Jun 28, 2026Jintao Kong, Zhihao Zhang, Weihuang Chen +4Reinforcement LearningRobot Navigation

  8. Modification-Considering Value Learning for Reward Hacking Mitigation in RL

    Jun 27, 2026Evgenii Opryshko, Umangi Jain, Igor GilitschenskiReward HackingReinforcement Learning

  9. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement LearningRL for Language Model Reasoning

  10. Neuromorphic Energy-Aware Learning for Adaptive Deep Brain Stimulation

    Jun 26, 2026Binh Nguyen, Colleen Josephson, Mircea Teodorescu +2Reinforcement LearningNeuromorphic Computing

  11. Tandem Reinforcement Learning with Verifiable Rewards

    Jun 26, 2026Difan Jiao, Raghav Singhal, Robert West +1Reinforcement LearningRL for Language Model Reasoning

  12. Regularized Reward-Punishment Reinforcement Learning

    Jun 26, 2026Jiexin Wang, Eiji UchibeReinforcement LearningKL-Regularized RL

  13. Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

    Jun 26, 2026Matthew Vandergrift, Esraa Elelimy, Martha WhiteRL BenchmarksReinforcement Learning

  14. Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF

    Jun 25, 2026Arnav RajAsynchronous RLReinforcement Learning

  15. Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

    Jun 25, 2026Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang +6RL for Code GenerationReinforcement Learning

  16. RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

    Jun 25, 2026Rongjian Chen, Jianmin Hu, Kejiang Ye +1Reinforcement LearningRL for Language Model Reasoning

  17. GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

    Jun 25, 2026Ting Zhou, Zhenqing Ling, Yiyang Zhao +2RL for Language ModelsLLM Alignment

  18. Revisiting Action Factorization for Complex Action Spaces

    Jun 25, 2026Timothy Flavin, Sandip SenReinforcement LearningActor-Critic Methods

  19. VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation

    Jun 25, 2026Tianxin Xie, Chenxing Li, Dong Yu +1Test-Time AdaptationReinforcement Learning

  20. Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy

    Jun 25, 2026Wenjie Huang, Yang Li, Jingjia Teng +6Reinforcement LearningReward Shaping

  21. Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

    Jun 25, 2026Erhan Bayraktar, Martin Hernandez, Qinxin Yan +1Reinforcement LearningStochastic Optimal Control

  22. Finding the Time to Think: Learning Planning Budgets in Real-Time RL

    Jun 24, 2026Aneesh Muppidi, Firas Darwish, Dylan Cope +2Reinforcement LearningPolicy Learning

  23. MPC-Injection: Biasing Off-Policy Locomotion RL Toward Controller-Induced Behavior Basins

    Jun 24, 2026Roy Xing, Seyoung Ree, Brian PlancherReinforcement LearningRL for Legged Locomotion

  24. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevReinforcement LearningCredit Assignment in RL

  25. Reinforcement Learning for Software Vulnerability Analysis: A Systematic Review with Emphasis on C/C++ Source Code and Static Analysis

    Jun 24, 2026Bruno Caro-Vásquez, Carola Figueroa-Flores, Gastón MarquezReinforcement LearningSoftware Vulnerability Detection

  26. OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

    Jun 24, 2026Wenxuan Jiang, Zining Fan, Zijian Zhang +6Open-Ended GenerationIntrinsic Reward Methods

  27. Low-Complexity Policy Tessellations in Structured Markov Decision Processes

    Jun 24, 2026Fredy PokouMarkov Decision ProcessesReinforcement Learning

  28. Implementation of reinforcement learning in chemical reaction networks: application to phototaxis as curiosity-driven exploration

    Jun 24, 2026Ruyi Tang, Grégoire Sergeant-Perthuis, David ColliauxDynamical SystemsReinforcement Learning