RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. Building Multi-Task Agentic LLMs via Two-Phase Distillation

    Jun 29, 2026Huaijie Wang, Shusheng Xu, Yi Wu +1Language Model DistillationMulti-Task RL

  2. ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

    Jun 29, 2026Abhijnan Nath, Nikhil KrishnaswamyBelief-Space PlanningCredit Assignment in RL

  3. SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

    Jun 29, 2026Aojie Yuan, Yi Nian, Haiyue Zhang +2AI Agent ReliabilityProcess Reward Models

  4. UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation

    Jun 28, 2026Songjun Tu, Chengdong Xu, Qichao Zhang +6Credit Assignment in RLLLM Agent Skill Learning

  5. ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents

    Jun 26, 2026Qitai Tan, Zefang Zong, Yang Li +1Agentic RLOn-Policy Distillation

  6. SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

    Jun 26, 2026Shuzheng Gao, Wenhao Zeng, Zhaojian Yu +5Software Engineering AgentsAgent Memory Management

  7. Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

    Jun 25, 2026Xuan Zhang, Zhijian Zhou, Lingfeng Qiao +6World Model-Based PlanningModel-Based Planning

  8. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

    Jun 24, 2026Changdae Oh, Wendi Li, Seongheon Park +3Process Reward ModelsRL Post-Training

  9. Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

    Jun 24, 2026Peng Xu, Sijia Chen, Junzhuo Li +1Reward ShapingCredit Assignment in RL

  10. BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

    Jun 24, 2026Hanyang Wang, Weijieying Ren, Yuxiang Zhang +4Group Relative Policy OptimizationRL for LLM Agents

  11. Tmax: A simple recipe for terminal agents

    Jun 22, 2026Hamish Ivison, Junjie Oscar Yin, Rulin Shao +3Synthetic Data GenerationTerminal Agents

  12. PhoneBuddy: Training Open Models for Agentic Phone Use

    Jun 22, 2026Zhengyang Tang, Xin Lai, Pengyuan Lyu +23Computer-Use AgentsMobile GUI Agents

  13. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

    Jun 19, 2026Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL

  14. Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning

    Jun 18, 2026Yanxi Chen, Weijie Shi, Boyi Hu +6Continual Learning for LLM AgentsCross-Domain Generalization

  15. MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments

    Jun 18, 2026Wei Yu, Suxing Liu, Minjie Yu +4Reinforcement LearningDeep Research Agents

  16. EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

    Jun 16, 2026Zhitong Wang, Songze Li, Hao Peng +4Agentic RLWorld Model Learning

  17. Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning

    Jun 16, 2026Yanwei Cui, Xing Zhang, Yulong Zhang +4Continual Learning for LLM AgentsNon-Stationary RL

  18. Context-Aware RL for Agentic and Multimodal LLMs

    Jun 15, 2026Peiyang Xu, Bangzheng Li, Sijia Liu +4Multimodal GroundingContrastive RL

  19. OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models

    Jun 15, 2026Tianyi Lin, Chuanyu Sun, Jingyi Zhang +6LLM Agent Skill LearningLong-Horizon LLM Agents

  20. PathRouter: Aligning Rewards with Retrieval Quality in Agentic Graph Retrieval-Augmented Generation

    Jun 15, 2026Bo Wang, Heyan Huang, Yaolin Li +6Reward ShapingGraph Retrieval-Augmented Generation

  21. SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

    Jun 14, 2026Jingru Guo, Xiangyuan Xue, Lian Zhang +6LLM Agent OrchestrationMultimodal Reasoning

  22. Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

    Jun 13, 2026Ömer Veysel Çağatan, Xuandong ZhaoReward HackingLanguage Model Safety Evaluation

  23. AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

    Jun 12, 2026Jixuan Chen, Jianzhi Shen, Haoqiang Kang +10LLM Agent OrchestrationEmbodied AI

  24. Retrospective Progress-Aware Self-Refinement for LLM Agent Training

    Jun 12, 2026Xinbei Ma, Congmin Zheng, Jiyang Qiu +11Reward ShapingLLM Agent Training

  25. From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

    Jun 11, 2026Rongxin Yang, Shenghong He, Siyuan Zhu +1Agentic RLProcess Reward Models