Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Provably Safe Sim-to-Real Transfer

    Sep 1, 2026Tingting Ni, Maryam KamgarpourReinforcement LearningSim-to-Real Transfer

  2. CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

    Sep 1, 2026Chaohui Guo, Michel Klein, Zhisheng HuangReinforcement LearningLLM Inference Scheduling

  3. Reinforcement Learning and Rule-Based Peer-to-Peer Pricing in Residential PV-BES Communities

    Sep 1, 2026Pablo Benalcazar, Maciej Kalka, Wilian Guamán +1Reinforcement LearningDynamic Pricing

  4. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  5. It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

    Sep 1, 2026Runpeng Dai, Kaili Huang, Changsung Kang +1Reinforcement LearningGenerative Retrieval

  6. Independent Reinforcement Learning in Discounted Markov Games

    Sep 1, 2026Asrin Efe Yorulmaz, Ugur Aydin, Tamer BasarReinforcement LearningGame Theory

  7. Provably Efficient Federated Reinforcement Learning with Linear Function Approximation and Logarithmic Communication Cost

    Aug 31, 2026Zihang Liang, Haochen Zhang, Lingzhou XueReinforcement LearningFederated RL

  8. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

    Aug 31, 2026Zhiqin Yang, Jingwen Fu, Yuhan Liu +16Reinforcement LearningRL for Language Model Reasoning

  9. Three Steps at a Time: Learning Representations from Action Sequences in Contrastive RL

    Aug 31, 2026Michal Korniak, Kamil Dybek, Benjamin Eysenbach +2Reinforcement LearningOffline RL

  10. Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

    Aug 31, 2026Olivier Serris, Stéphane Doncieux, Olivier SigaudReinforcement LearningSparse-Reward RL

  11. Uncertainty-Driven Replay Memory for Reinforcement Learning

    Aug 30, 2026Sheeraja Rajakrishnan, Alexander G. Ororbia, Travis Desell +1Reinforcement LearningGeneralization in RL

  12. RIPE++: Reinforced Keypoint Learning from Positive Pairs Only

    Aug 20, 2026Johannes Künzel, Peter Eisert, Anna HilsmannRepresentation LearningReinforcement Learning

  13. RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

    Aug 19, 2026Yugu Li, Zehong Cao, Jianglin Qiao +1Agentic RLReinforcement Learning

  14. OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways

    Aug 13, 2026Mao Jiayang, Wang Lanfeng, Peng Zhao-HanReinforcement LearningMobile Robotics

  15. Online Inference for Quantile Temporal Difference Learning in Distributional Reinforcement Learning

    Aug 13, 2026Zijie Cheng, Yang Peng, Zhihua ZhangDistributional RLReinforcement Learning

  16. A Deep RL based Framework for Targeted White Matter Tractography

    Aug 13, 2026Ankita JoshiReinforcement LearningMagnetic Resonance Imaging

  17. Revisiting Overestimation Bias Problem of Q-learning: Settling Large Discrete Action Space via Action Intersection

    Aug 13, 2026Pu Li, Tao Tan, Hong Xie +2Reinforcement LearningDeep Q-Learning

  18. Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry

    Aug 13, 2026Larissa Xu, King Bi, William ChangRegret Minimization in RLReinforcement Learning

  19. CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

    Aug 12, 2026Linqiang Guo, Li Gu, Zihuan Jiang +8Reinforcement LearningRL for GUI Agents

  20. Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

    Aug 11, 2026Aditya Humnabadkar, Huaizhong Zhang, Ardhendu BeheraReinforcement LearningAutonomous Driving Safety Evaluation

  21. PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

    Aug 11, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Inverse Probability WeightingReinforcement Learning

  22. Efficient Hypergradient Descent for Inverse Reinforcement Learning

    Aug 11, 2026Nikita Sevriukov, Anna Barabanova, Uliana Gagarina +4Reinforcement LearningGradient Descent

  23. IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning

    Aug 11, 2026Zefeng Liang, Jie Qiao, Ruichu Cai +2Reinforcement LearningRobust RL

  24. Reinforcement Learning-Based Laser Cutting Machine Parameter Optimization

    Aug 11, 2026Khanh Quan Pham, Majid Kundroo, Geunwoo Ban +2ManufacturingReinforcement Learning

  25. TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling

    Aug 11, 2026Yanyu Ren, Xizheng Wang, Xiao Liu +8Agentic RLAsynchronous RL