Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach

    May 27, 2026Guang-Yuan Hao, Lars van der Laan, Aurélien Bibaut +1Reinforcement LearningMinimax Estimation

  2. Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

    May 26, 2026Zehao Liu, Yuanpu Cao, Jinghui Chen +1Reinforcement LearningOn-Policy Self-Distillation

  3. Transferable Reinforcement Learning via Probabilistic Latent Embeddings and Dynamic Policy Adaptation for Sim-to-Real Deployment

    May 26, 2026Gengyue Han, Yiheng FengReinforcement LearningSim-to-Real Transfer

  4. Accelerating Reinforcement Learning Training Using Simulation Surrogate Models

    May 26, 2026Mohammadmahdi Ghasemloo, David J. Eckman, Yaxian LiSurrogate ModelingReinforcement Learning

  5. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Reinforcement LearningKL-Regularized RL

  6. SQARL: A Size-Agnostic Reinforcement Learning approach for Circuit Allocation in Distributed Quantum Architectures

    May 26, 2026Víctor Carballo, Júlia López-Closa, Mario MartinReinforcement Learning

  7. Darwin Mobile Agent: A Roadmap for Self-Evolution

    May 26, 2026Daniel Beechey, Derek Yuen, Jianheng Liu +5Reinforcement LearningRL for GUI Agents

  8. Probabilistic Recurrent Intention Switching Model

    May 26, 2026Wenyuan Sheng, Hao Zhu, Joschka BoedeckerReinforcement Learning

  9. REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization

    May 26, 2026Yong Li, Furong Jia, Dacheng Yin +4Retrieval-Augmented GenerationReinforcement Learning

  10. Towards Generalization-Oriented Models for Vehicle Routing Problems with Mixture-of-Experts

    May 26, 2026Changhao Miao, Yuntian Zhang, Tongyu Wu +2Reinforcement LearningAdaptive Model Routing

  11. MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation

    May 26, 2026Zichun Wang, Hairong Shi, Bingzheng Wei +2Image SegmentationReinforcement Learning

  12. Transformer-Enhanced Reinforcement Learning: Fundamentals and Applications in Communication Networks

    May 26, 2026Nguyen Cong Luong, Shaohan Feng, Nguyen Duc Hai +10Reinforcement LearningTransformer-Based RL

  13. Heterogeneous AAV Logistics Task Allocation: A Reinforcement Learning Enhanced Overlapping Coalition Formation Game Approach

    May 26, 2026Yuze Zhou, Jingliang Sun, Junzhi Li +3Reinforcement LearningTransformer-Based RL

  14. Balancing Plasticity and Stability with Fast and Slow Successor Features

    May 25, 2026Raymond Chua, Doina Precup, Blake RichardsStability-Plasticity DilemmaNon-Stationary RL

  15. Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

    May 25, 2026Tianda Sun, Dimitar KazakovTool-Use EvaluationReinforcement Learning

  16. Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning

    May 25, 2026Aleksandar Todorov, Matthia SabatelliRepresentation LearningReinforcement Learning

  17. When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

    May 25, 2026Li Wang, Xiaodong Lu, Xiaohan Wang +5Reinforcement LearningRL for Language Model Reasoning

  18. Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

    May 25, 2026Hyungkyu Kang, Byeongchan Kim, Min-hwan OhReinforcement LearningOffline RL

  19. Learning to Search and Searching to Learn for Generalization in Planning

    May 25, 2026Michael Aichmüller, Yannik Hesse, Hector GeffnerReinforcement LearningGeneralization in RL

  20. Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models

    May 25, 2026Zongji Yu, Wenshui Luo, Yiliu Sun +5Reinforcement LearningRL for Language Model Reasoning

  21. Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System

    May 25, 2026Yuhui Hu, Dong Zhou, Kaihong Ouyang +3Robotic ControlReinforcement Learning

  22. Latent Q-Barrier Shielding for Safe In-Context Reinforcement Learning

    May 24, 2026Minjae Kwon, Amir Moeini, Shangtong Zhang +1Reinforcement LearningControl Barrier Functions

  23. Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

    May 24, 2026Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng +2Reinforcement LearningRL for Language Model Reasoning

  24. Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat

    May 24, 2026Chengwei Li, Junlin Liu, Yang GaoMulti-Agent CoordinationReinforcement Learning

  25. A perspective on fluid mechanical environments for challenges in reinforcement learning

    May 24, 2026Shruti Mishra, Michael Chang, Vamsi Spandan +1RL ControlNon-Stationary RL

  26. Scaling up Energy-Aware Multi-Agent Reinforcement Learning for Mission-Oriented Drone Networks with Individual Reward

    May 24, 2026Changling Li, Ying LiReinforcement LearningCredit Assignment in RL