RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

    Jul 19, 2026Amez Amanj Ali, Kuo-Kun TsengReward ModelingLLM Self-Correction

  2. Process Reward Informed Tree Rollout for Effective Multi-Turn RL

    Jul 17, 2026Xintong Li, Sha Li, Yuwei Zhang +8Reinforcement LearningRL Exploration

  3. SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

    Jul 16, 2026Jinyang Wu, Shuo Yang, Zhengxi Lu +8Agentic RLOn-Policy Distillation

  4. SPyCE: Skill-Policy Co-evolution for Multimodal Agents

    Jul 15, 2026Ru Zhang, Weijie QiuMultimodal ReasoningAgent Skill Learning

  5. Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

    Jul 15, 2026Bowei He, Yankai Chen, Xiaokun Zhang +1Reinforcement LearningPolicy Gradient Methods

  6. A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

    Jul 14, 2026Chengguang Gan, Zhixi Cai, Yunhao Liang +3Group Relative Policy OptimizationRL Fine-Tuning

  7. SETA: Scaling Environments for Terminal Agents

    Jul 12, 2026Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru +19Reinforcement LearningTerminal Agents

  8. GRASP: GRanularity-Aware Search Policy for Agentic RAG

    Jul 11, 2026Varun Gandhi, Jaewook Lee, Shantanu Todmal +4Multi-Hop QARetrieval-Augmented Generation

  9. Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

    Jul 8, 2026Zetian Hu, Shunyu Liu, Junjie Zhang +4Agentic RLGroup Relative Policy Optimization

  10. EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

    Jul 7, 2026Mianqiu Huang, Taofeng Xue, Chong Peng +12RL for GUI AgentsPartially Observable RL

  11. Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

    Jul 7, 2026Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao +2Multi-Agent NegotiationAutomated Negotiation

  12. CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

    Jul 6, 2026Yujiang Li, Zhenyu Hou, Yi Jing +2Software Engineering AgentsLong-Horizon LLM Agents

  13. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10RL for Language Model ReasoningLLM-Guided RL

  14. STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

    Jul 6, 2026Qiuyi Qi, Tian Liang, Mutian Bao +8Uncertainty QuantificationSparse-Reward RL

  15. Multi-Turn On-Policy Distillation with Prefix Replay

    Jul 6, 2026Baohao Liao, Hanze Dong, Christof Monz +3LLM Agent TrainingOn-Policy Distillation

  16. Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

    Jul 5, 2026Haiwen Yi, Xinyuan SongOffline RLLLM Agent Harnesses

  17. Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

    Jul 4, 2026Weiyang Guo, Zesheng Shi, Longhui Zhang +3Reinforcement LearningCredit Assignment in RL

  18. Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

    Jul 2, 2026Mingzhe Du, Luu Anh Tuan, Tianyi Wu +4Software Engineering AgentsCybersecurity

  19. DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents

    Jul 2, 2026Tianyi Zhang, Mousumi Das, Abrar Anwar +2Conversational AgentsRL for LLM Agents

  20. World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

    Jul 1, 2026Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan +1LLM Agent EvaluationAI Agent Benchmarks

  21. QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

    Jun 30, 2026Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina +3Long-Horizon Agent EvaluationAI Agent Benchmarks

  22. TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

    Jun 30, 2026Yuanda Xu, Zhengze Zhou, Hejian Sang +6Agentic RLStep-Level Credit Assignment in RL

  23. What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

    Jun 30, 2026Chen Liu, Ling Chen, Hanzhang Zhou +7RL for GUI AgentsGUI Agents

  24. SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

    Jun 30, 2026Ming Dai, Zhihong Lu, Jinjie Gu +5Tool-Augmented Language Model AgentsAgentic Search