Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

    May 14, 2026Matias Alvo, Daniel Russo, Yash KanoriaRL ControlReinforcement Learning

  2. CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

    May 14, 2026Zhenyang Ni, Yijiang Li, Ruochen Jiao +7Video Diffusion ModelsReinforcement Learning

  3. Diagnosing Training Inference Mismatch in LLM Reinforcement Learning via a Zero-Mismatch Reference

    May 14, 2026Tianle Zhong, Neiwen Ling, Yifan Pi +5Reinforcement LearningLLM Inference

  4. R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning

    May 13, 2026Sanghyeob Song, Donghyeok Lee, Jinsik Kim +1Reinforcement LearningSelf-Supervised Learning

  5. Tight Sample Complexity Bounds for Entropic Best Policy Identification

    May 13, 2026Amer Essakine, Claire VernadeReinforcement LearningRisk-Sensitive RL

  6. Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation

    May 13, 2026Asim Osman, Sasha Abramowitz, Mark Bergh +13Reinforcement LearningContrastive RL

  7. CA2: Code-Aware Agent for Automated Game Testing

    May 13, 2026Valliappan Chidambaram Adaikkappan, Vincent Martineau, Joshua Romoff +1Automated Software TestingReinforcement Learning

  8. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  9. Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning

    May 13, 2026Stefan Stojanovic, Alexandre ProutiereRepresentation LearningReinforcement Learning

  10. Offline Two-Player Zero-Sum Markov Games with KL Regularization

    May 13, 2026Claire Chen, Yuheng Zhang, Xinyu Liu +3Nash EquilibriumReinforcement Learning

  11. Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints

    May 13, 2026Timofey TomashevskiyNon-Stationary RLReinforcement Learning

  12. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2RL for Language ModelsReinforcement Learning

  13. Quantifying Potential Observation Missingness in Inverse Reinforcement Learning

    May 12, 2026Leo Benac, Abhishek Sharma, Alihan Huyuk +1Reinforcement LearningHealthcare

  14. ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

    May 12, 2026Nirmal Patel, Fei Wang, Inderjit S. DhillonRL for Language ModelsReinforcement Learning

  15. Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning

    May 12, 2026Wo Wei Lin, Ethan Rathbun, Enrico Marchesini +1Reinforcement LearningRobust RL

  16. Plan Before You Trade: Inference-Time Optimization for RL Trading Agents

    May 12, 2026Eun Go, Rohan Deb, Arindam BanerjeeReinforcement LearningInference-Time Optimization

  17. Reward Hacking in Rubric-Based Reinforcement Learning

    May 12, 2026Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3Reward HackingReinforcement Learning

  18. Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Programs

    May 12, 2026Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu +1RL BenchmarksReinforcement Learning

  19. Discrete Flow Matching for Offline-to-Online Reinforcement Learning

    May 12, 2026Fairoz Nower Khan, Nabuat Zaman Nahim, Peizhong JuFlow MatchingReinforcement Learning

  20. Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling

    May 12, 2026Chenran Zhao, Dianxi Shi, Yaowen Zhang +2Causal Representation LearningReinforcement Learning

  21. Delay-Empowered Causal Hierarchical Reinforcement Learning

    May 12, 2026Chenran Zhao, Dianxi Shi, Haotian Wang +4Reinforcement LearningHierarchical RL

  22. Intrinsic Vicarious Conditioning for Deep Reinforcement Learning

    May 12, 2026Rodney A Sanchez, Ferat Sahin, Alex Ororbia +1Reinforcement LearningIntrinsic Motivation

  23. On the Importance of Multistability for Horizon Generalization in Reinforcement Learning

    May 12, 2026Asad Bakija, Florent De Geeter, Julien Brandoit +2Dynamical SystemsReinforcement Learning

  24. Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

    May 12, 2026Zhong Guan, Yongjian Guo, Haoran Sun +5Asynchronous RLReinforcement Learning

  25. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  26. From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

    May 12, 2026Guobin Shen, Lei Huang, Xiang Cheng +4Reinforcement LearningOn-Policy Self-Distillation