RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs

    May 12, 2026Xiaoyuan Li, Moxin Li, Keqin Bao +4LLM Agent Skill LearningLLM Agent Skill Retrieval

  2. GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

    May 12, 2026Sijia Li, Yuchen Huang, Zifan Liu +7RL for Language Model ReasoningCredit Assignment in RL

  3. Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty

    May 12, 2026Joykirat Singh, Zaid Khan, Archiki Prasad +5Partially Observable RLBayesian Inference

  4. RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

    May 11, 2026Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang +9Reinforcement LearningRubric-Based RL

  5. Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

    May 11, 2026Zhiyuan Fan, Wenwei Jin, Feng Zhang +4Reinforcement LearningLanguage Model Self-Improvement

  6. DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning

    May 11, 2026Haoyu Huang, Jiaxin Bai, Shujie Liu +6Knowledge EditingKnowledge Augmentation for Language Models

  7. Verifiable Process Rewards for Agentic Reasoning

    May 11, 2026Huining Yuan, Zelai Xu, Huaijie Wang +6Process Reward ModelsCredit Assignment in RL

  8. Skill-R1: Agent Skill Evolution via Reinforcement Learning

    May 10, 2026Yash Vishe, Rohan Surana, Xunyi Jiang +8Agent Skill LearningRL for LLM Agents

  9. PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

    May 10, 2026Dongyi Liu, Yifan Niu, Qinwen Wang +2Reinforcement LearningReward Shaping

  10. Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

    May 9, 2026Xingyuan Hua, Sheng Yue, Ju RenRL for Language Model ReasoningTest-Time Scaling

  11. EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

    May 9, 2026Chengdong Xu, Kaiqiang Ke, Ziheng Liu +4Multi-Agent LLM SystemsMulti-Agent System Optimization

  12. SkillMaster: Toward Autonomous Skill Mastery in LLM Agents

    May 9, 2026Min Yang, Jinghua Piao, Xu Xia +4LLM Agent Self-ImprovementLLM Agent Skill Learning

  13. Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

    May 9, 2026Wenzhi Fang, Liangqi Yuan, Guangchen Lan +2Multi-Agent LLM SystemsMulti-Agent Coordination

  14. Towards Autonomous Business Intelligence via Data-to-Insight Discovery Agent

    May 8, 2026Dongming Wu, Junwen Li, Ming Lu +2AI-Assisted Decision MakingRL for LLM Agents

  15. MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments

    May 8, 2026Yicheng Gao, Xiaolin Zhou, Yahan Li +2HealthcareMedical Diagnosis

  16. PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

    May 7, 2026Minghao Yan, Bo Peng, Benjamin Coleman +11Test-Time AdaptationReinforcement Learning

  17. SkillOS: Learning Skill Curation for Self-Evolving Agents

    May 7, 2026Siru Ouyang, Jun Yan, Yanfei Chen +13Continual Learning for LLM AgentsLLM Agent Skill Learning

  18. A2^2TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

    May 7, 2026Dingwei Chen, Zefang Zong, Zhipeng Ma +5Credit Assignment in RLPolicy Gradient Methods

  19. Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

    May 7, 2026Yaorui Shi, Yuxin Chen, Zhengxi Lu +6LLM Agent Skill LearningLLM Agent Skill Retrieval

  20. Milestone-Guided Policy Learning for Long-Horizon Language Agents

    May 7, 2026Zixuan Wang, Yuchen Yan, Hongxing Li +7Credit Assignment in RLLong-Horizon Agent Tasks

  21. From History to State: Constant-Context Skill Learning for LLM Agents

    May 6, 2026Haoyang Xie, Xinyuan Wang, Yancheng Wang +2LLM Agent Skill LearningLLM Agent Training

  22. OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents

    May 6, 2026Shuang Chen, Kaituo Feng, Hangting Chen +7Multimodal IRMultimodal Search Agents

  23. On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length

    May 4, 2026Sunghwan Kim, Junhee Cho, Beong-woo Kwak +6Long-Horizon PlanningLength Generalization

  24. T2^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning

    May 4, 2026Haixin Wang, Hejie Cui, Chenwei Zhang +7Agentic RLReinforcement Learning

  25. Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory

    May 1, 2026Derong Xu, Shuochen Liu, Pengfei Luo +8Memorization in Language ModelsMemorization in Generative Models