Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Generalizable Multi-Task Learning for Wireless Networks Using Prompt Decision Transformers

    Jun 3, 2026Fatih Temiz, Shavbo Salehi, Melike Erol-KantarciReinforcement LearningTransformer

  2. From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments

    Jun 2, 2026Saket Tiwari, Tejas Kotwal, George KonidarisRL ControlReinforcement Learning

  3. Exact Unlearning in Reinforcement Learning

    Jun 2, 2026Thanh Nguyen-Tang, Raman AroraReinforcement LearningMachine Unlearning

  4. Smart Transportation Without Neurons -- Fair Metro Network Expansion with Tabular Reinforcement Learning

    Jun 2, 2026Dimitris Michailidis, Sennay Ghebreab, Fernando P. SantosReinforcement LearningIntelligent Transportation Systems

  5. EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

    Jun 2, 2026Guilin Zhang, Chuanyi Sun, Kai Zhao +3Early StoppingReinforcement Learning

  6. QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

    Jun 2, 2026Rongzhi Zhang, Rui Feng, Zhihan Zhang +8Reinforcement LearningRL for Language Model Reasoning

  7. Easy-to-Use Shielding for Reinforcement Learning

    Jun 2, 2026Stefan Pranger, Bettina KönighoferReinforcement LearningRL Exploration

  8. Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

    Jun 2, 2026Jiahui Li, Jianfeng Shan, Wenpei Chen +5Reinforcement LearningLLM Answer Verification

  9. A Goal-Set Characterization of Task Composition in the Boolean Task Algebra

    Jun 2, 2026Eduardo Terrés-Caballero, Herke van HoofReinforcement LearningGoal-Conditioned RL

  10. Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions

    Jun 2, 2026Bingxu Liu, Jiashun Liu, Johan Obando-Ceron +5Non-Stationary RLReinforcement Learning

  11. RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

    Jun 2, 2026Xian Qi Loye, Qinglin Su, Zhexin Zhang +5Reinforcement LearningAI Agent Safety

  12. When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

    Jun 2, 2026Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan +1Reward HackingLLM Evaluation

  13. EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

    Jun 2, 2026Guhong Chen, Yingcheng Shi, Yongbin Li +6RL for Code GenerationAgentic RL

  14. Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling

    Jun 2, 2026Runpeng Dai, Tong Zheng, Rui Liu +2Reinforcement LearningTest-Time Scaling

  15. Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR

    Jun 2, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +3Continual Learning for LLMsReinforcement Learning

  16. Libra: Efficient Resource Management for Agentic RL Post-Training

    Jun 2, 2026Kaiwen Chen, Xin Tan, Jingzong Li +6Agentic RLReinforcement Learning

  17. ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL

    Jun 2, 2026Yikang Gui, Bikramjit Banerjee, Prashant DoshiDisentangled Representation LearningReinforcement Learning

  18. Fairness Definitions and Metrics in Deep Reinforcement Learning for Drug Discovery in Healthcare: A Rapid Evidence Review

    Jun 1, 2026Esmaeil Shakeri, Ronnie de Souza Santos, Behrouz FarReinforcement LearningAlgorithmic Fairness

  19. Position: Deployed Reinforcement Learning should be Continual

    Jun 1, 2026Parnian Behdin, Kevin Roice, Golnaz MesbahiNon-Stationary RLReinforcement Learning

  20. A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

    Jun 1, 2026Lei Yang, Siyu Ding, Deyi XiongRL for Language ModelsReinforcement Learning

  21. Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

    Jun 1, 2026Pengcheng Jiang, Zhiyi Shi, Kelly Hong +5Reinforcement LearningAgentic Retrieval

  22. Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing

    Jun 1, 2026Azal Ahmad Khan, Ammar Ahmed, Zeshan Fayyaz +3Reinforcement LearningGroup Relative Policy Optimization

  23. Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

    Jun 1, 2026Christian Scherer, Joe Watson, Theo Gruner +3Reinforcement LearningRobot Skill Learning

  24. Explainable Data-driven Deep Reinforcement Learning Methods for Optimal Energy Management in Buildings

    Jun 1, 2026Hallah Shahid Butt, Qiong Huang, Gökhan Demirel +6RL ControlReinforcement Learning

  25. RDA: Reward Design Agent for Reinforcement Learning

    Jun 1, 2026Hojoon Lee, Ajay Subramanian, Ben Abbatematteo +4Agentic RLReinforcement Learning

  26. QSplitFL: Capability Aware Deep Q-Learning for Optimal Split Point Selection in Split Federated Learning

    Jun 1, 2026Nazmus Shakib Shadin, Xinyue Zhang, Jingyi Wang +1Reinforcement LearningDeep Q-Learning