RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

    May 1, 2026Haotian Zhao, Songlin Zhou, Yuxin Zhang +9Agentic RLCredit Assignment in RL

  2. Exploration Hacking: Can LLMs Learn to Resist RL Training?

    Apr 30, 2026Eyon Jang, Damon Falck, Joschka Braun +6RL ExplorationLLM Safety

  3. Rethinking Agentic Reinforcement Learning In Large Language Models

    Apr 30, 2026Fangming Cui, Ruixiao Zhu, Cheng Fang +2RL for Language ModelsAgentic RL

  4. FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards

    Apr 29, 2026Zhixin Han, Yanzhi Zhang, Chuyang Wei +11Agentic RLReinforcement Learning

  5. DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

    Apr 27, 2026Junshuo Zhang, Chengrui Huang, Feng Guo +6Reinforcement LearningRL Exploration

  6. Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

    Apr 27, 2026Zhisong Qiu, Shuofei Qiao, Kewei Xu +4Process Reward ModelsRL for LLM Agents

  7. JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training

    Apr 26, 2026Zhengding Hu, Hehua Ouyang, Chang Chen +6RL Post-TrainingPipeline Parallelism

  8. Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents

    Apr 22, 2026Yuxuan Cai, Wei Li, Jie Zhou +4Lifelong Learning AgentsLLM Agent Skill Learning

  9. DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

    Apr 21, 2026Shengqin Wang, Wentao Yan, Huichi Zhou +4Reward ShapingRL for Language Model Reasoning

  10. SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

    Apr 21, 2026Xiachong Feng, Yi Jiang, Xiaocheng Feng +9Credit Assignment in RLStep-Level Credit Assignment in RL

  11. StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

    Apr 20, 2026Daoyu Wang, Qingchuan Li, Mingyue Cheng +4Agentic RLCredit Assignment in RL

  12. Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

    Apr 20, 2026Guanting Dong, Junting Lu, Junjie Huang +17Lifelong Learning AgentsAI Agent Benchmarks

  13. CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

    Apr 19, 2026Hansi Zeng, Liam Collins, Bhuvesh Kumar +2Reinforcement LearningLearning to Rank

  14. AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning

    Apr 19, 2026Jingbo Sun, Wenyue Chong, Songjun Tu +7Agentic RetrievalAgentic RAG

  15. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Reinforcement LearningRL Post-Training

  16. CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

    Apr 17, 2026Shidong Yang, Ziyu Ma, Tongwen Huang +3LLM Agent TrainingRL for LLM Agents

  17. "Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations

    Apr 16, 2026Yang Wu, Jinhong Yu, Jingwei Xiong +2AI-Assisted Scientific ResearchLLM Agents

  18. Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

    Apr 16, 2026Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao +1LLM Agent TrainingRL for LLM Agents

  19. Mind DeepResearch Technical Report

    Apr 16, 2026MindDR Team, Li Auto IncMulti-Agent LLM SystemsDeep Research Agents

  20. TRACE: Capability-Targeted Agentic Training

    Apr 7, 2026Hangoo Kang, Tarun Suresh, Jon Saad-Falcon +1LLM Agent Self-ImprovementAgent Skill Learning

  21. Marginal-Contribution Policy Gradients under Filtered Feedback for Multi-Agent LLMs

    Apr 3, 2026Elai Ben-Gal, Stela TongMulti-Agent LLM SystemsMulti-Agent System Optimization

  22. Complementary RL: Towards Efficient Experience-Driven Agent Learning

    Mar 18, 2026Dilxat Muhtar, Jiashun Liu, Wei Gao +8Reinforcement LearningSample-Efficient RL

  23. Agentic Critical Training

    Mar 9, 2026Weize Liu, Minghui Liu, Sy-Tuyen Ho +5LLM Agent TrainingImitation Learning

  24. Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning

    Feb 13, 2026Kehao Zhang, Shangtong Gui, Sheng Yang +2Persistent Memory for Language ModelsLong-Context Inference

  25. TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents

    Feb 12, 2026Aladin Djuhera, Swanand Kadhe, Farhan Ahmed +3Tree SearchLLM Agent Training

  26. Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

    Feb 9, 2026Lang Feng, Longtao Zheng, Shuo He +2Multi-Agent LLM SystemsMulti-Agent System Optimization

  27. SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning

    Feb 9, 2026Peng Xia, Jianwen Chen, Hanyang Wang +10LLM Agent Skill LearningRL for LLM Agents