Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. GUIDE: Reinforcement Learning for Behavioral Action Support in Type 1 Diabetes

    Apr 1, 2026Saman Khamesian, Sri Harini Balaji, Di Yang Shi +5Reinforcement LearningType 1 Diabetes

  2. Generalizable Dense Reward for Long-Horizon Robotic Tasks

    Mar 31, 2026Silong Yong, Stephen Sheng, Carl Qi +6Reinforcement LearningLong-Horizon Robotic Manipulation

  3. Learning to Remember: Attentive Reinforcement Learning for Edge Serverless Autoscaling

    Mar 21, 2026Faraz Shaikh, Gianluca Reali, Mauro FemminellaRL ControlReinforcement Learning

  4. DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management

    Mar 20, 2026Yaqi Xie, Xinru Hao, Jiaxi Liu +4Inventory ControlReinforcement Learning

  5. Complementary RL: Towards Efficient Experience-Driven Agent Learning

    Mar 18, 2026Dilxat Muhtar, Jiashun Liu, Wei Gao +8Reinforcement LearningSample-Efficient RL

  6. Posterior Sampling Reinforcement Learning with Gaussian Processes for Continuous Control: Sublinear Regret Bounds for Unbounded State Spaces

    Mar 9, 2026Hamish Flynn, Joe Watson, Ingmar Posner +1RL ControlRegret Minimization in RL

  7. RL unknotter, hard unknots and unknotting number

    Mar 9, 2026Anne Dranowski, Yura Kabkov, Daniel TubbenhauerReinforcement Learning

  8. Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

    Mar 5, 2026Shan Ning, Longtian Qiu, Xuming HeVisual Question AnsweringReinforcement Learning

  9. GIPO: Gaussian Importance Sampling Policy Optimization

    Mar 4, 2026Chengxuan Lu, Zhenquan Zhang, Shukuan Wang +3Reinforcement LearningRL Post-Training

  10. Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

    Mar 3, 2026Jiyuan Wang, Chunyu Lin, Lei Sun +8Multi-View ConsistencyReinforcement Learning

  11. Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

    Feb 26, 2026Chris Samarinas, Haw-Shiuan Chang, Hamed ZamaniReinforcement LearningProcess Reward Models

  12. A Model-Free Universal AI

    Feb 26, 2026Yegon Kim, Juho LeeReinforcement LearningBayesian RL

  13. ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

    Feb 25, 2026Xiaoxuan Wang, Han Zhang, Haixin Wang +11Agentic RLReinforcement Learning

  14. Multi-Agent Reinforcement Learning for V2X Resource Allocation: Disentangling MARL Challenges Through Benchmarking

    Feb 18, 2026Siyuan Wang, Lei Lei, Pranav Maheshwari +2RL BenchmarksReinforcement Learning

  15. MyoInteract: A Framework for Fast Prototyping of Biomechanical HCI Tasks using Reinforcement Learning

    Feb 16, 2026Ankit Bhattarai, Hannah Selder, Florian Fischer +2Reinforcement LearningHuman Behavior Simulation

  16. Calculating Mutual Information between a Reward Maximizer and its Environment

    Feb 13, 2026Alfred Harwood, Jose Faustino, Alex AltairMarkov Decision ProcessesReinforcement Learning

  17. TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction

    Feb 12, 2026Yongyao Wang, Ziqi Miao, Lu Yang +4In-Context Example SelectionReinforcement Learning

  18. Can We Really Learn One Representation to Optimize All Rewards?

    Feb 11, 2026Chongyi Zheng, Royina Karegoudra Jayanth, Benjamin EysenbachUnsupervised LearningRepresentation Learning

  19. Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT

    Feb 11, 2026Jiacheng Wang, Zhijie Liu, Ping Jian +4Supervised Fine-TuningReinforcement Learning

  20. Reinforcement learning with an expectile-based objective

    Feb 10, 2026Shrey Rakeshkumar Patel, Sumedh Gupte, Soumen Pachal +2Reinforcement LearningRisk-Sensitive RL

  21. SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity

    Feb 9, 2026Shae McFadden, Myles Foley, Elizabeth Bates +5Reinforcement LearningCybersecurity

  22. Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation

    Feb 9, 2026Marc Toussaint, Cornelius V. Braun, Armand Jordana +5Reinforcement LearningNon-Prehensile Manipulation

  23. RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

    Feb 8, 2026Hongzhi Zang, Shu'ang Yu, Hao Lin +14Robot Policy LearningReinforcement Learning

  24. rePIRL: Learn PRM with Inverse RL for LLM Reasoning

    Feb 8, 2026Xian Wu, Kaijie Zhu, Ying Zhang +2Reinforcement LearningProcess Reward Models

  25. F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

    Feb 6, 2026Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov +4Reinforcement LearningRL for Language Model Reasoning

  26. On the Role of Computation in Reinforcement Learning

    Feb 5, 2026Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko +1Reinforcement LearningModel-Free RL