Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,147

All topics
CardsList
  1. Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning

    May 14, 2026Oubo Ma, Ruixiao Lin, Yang Dai +4Reinforcement LearningBackdoor Attacks

  2. Fully Dynamic Rebalancing in Dockless Bike-Sharing Systems via Deep Reinforcement Learning

    May 14, 2026Edoardo Scarpel, Alberto Pettena, Matteo Cederle +3RL ControlReinforcement Learning

  3. ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization

    May 14, 2026Letian Yang, Xu Liu, Yiqiang Lu +3Reinforcement LearningOffline-To-Online RL

  4. Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

    May 14, 2026Zeli Su, Ziyin Zhang, Zhou Liu +7Reinforcement LearningLow-Resource MT

  5. Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry

    May 14, 2026Zuyuan Zhang, Carlee Joe-Wong, Tian LanReinforcement LearningTrajectory Representation Learning

  6. Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

    May 14, 2026Matias Alvo, Daniel Russo, Yash KanoriaRL ControlReinforcement Learning

  7. CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

    May 14, 2026Zhenyang Ni, Yijiang Li, Ruochen Jiao +7Video Diffusion ModelsReinforcement Learning

  8. Diagnosing Training Inference Mismatch in LLM Reinforcement Learning via a Zero-Mismatch Reference

    May 14, 2026Tianle Zhong, Neiwen Ling, Yifan Pi +5Reinforcement LearningLLM Inference

  9. R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning

    May 13, 2026Sanghyeob Song, Donghyeok Lee, Jinsik Kim +1Reinforcement LearningSelf-Supervised Learning

  10. Tight Sample Complexity Bounds for Entropic Best Policy Identification

    May 13, 2026Amer Essakine, Claire VernadeReinforcement LearningRisk-Sensitive RL

  11. Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation

    May 13, 2026Asim Osman, Sasha Abramowitz, Mark Bergh +13Reinforcement LearningContrastive RL

  12. CA2: Code-Aware Agent for Automated Game Testing

    May 13, 2026Valliappan Chidambaram Adaikkappan, Vincent Martineau, Joshua Romoff +1Automated Software TestingReinforcement Learning

  13. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  14. Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning

    May 13, 2026Stefan Stojanovic, Alexandre ProutiereRepresentation LearningReinforcement Learning

  15. Offline Two-Player Zero-Sum Markov Games with KL Regularization

    May 13, 2026Claire Chen, Yuheng Zhang, Xinyu Liu +3Nash EquilibriumReinforcement Learning

  16. Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints

    May 13, 2026Timofey TomashevskiyNon-Stationary RLReinforcement Learning

  17. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2RL for Language ModelsReinforcement Learning

  18. Quantifying Potential Observation Missingness in Inverse Reinforcement Learning

    May 12, 2026Leo Benac, Abhishek Sharma, Alihan Huyuk +1Reinforcement LearningHealthcare

  19. ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

    May 12, 2026Nirmal Patel, Fei Wang, Inderjit S. DhillonRL for Language ModelsReinforcement Learning

  20. Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning

    May 12, 2026Wo Wei Lin, Ethan Rathbun, Enrico Marchesini +1Reinforcement LearningRobust RL

  21. Plan Before You Trade: Inference-Time Optimization for RL Trading Agents

    May 12, 2026Eun Go, Rohan Deb, Arindam BanerjeeReinforcement LearningInference-Time Optimization

  22. Reward Hacking in Rubric-Based Reinforcement Learning

    May 12, 2026Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3Reward HackingReinforcement Learning

  23. Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Programs

    May 12, 2026Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu +1RL BenchmarksReinforcement Learning

  24. Discrete Flow Matching for Offline-to-Online Reinforcement Learning

    May 12, 2026Fairoz Nower Khan, Nabuat Zaman Nahim, Peizhong JuFlow MatchingReinforcement Learning