RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +4Agentic SearchCredit Assignment in RL

  2. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Process Reward ModelsCredit Assignment in RL

  3. Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering

    Aug 2, 2026Aounon Kumar, Sudipta Paul, Vivek Kulkarni +2Multi-Hop QAAgentic RAG

  4. PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

    Aug 2, 2026Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni +4Reward ShapingLLM-Guided RL

  5. SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

    Aug 1, 2026Tao Liu, Tao Feng, Xiangheng Li +9Reinforcement LearningText-to-SQL

  6. RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

    Jul 31, 2026Chengbo Liu, Lifang Zhou, Ruijie Yan +8Reward ShapingOffline RL

  7. Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

    Jul 31, 2026Bohan Chen, Shivam N. Patel, Richard Hoffmann +2LLM Agent VerificationTool-Using Agents

  8. Cross-Benchmark Generalization in Long-Horizon Agents

    Jul 31, 2026Sushant Mehta, Logan Ritchie, Liudas Panavas +1Long-Horizon Agent EvaluationRL Post-Training

  9. MemHarness: Memory Is Reconstructed, Not Replayed

    Jul 30, 2026Rong Wu, Daocheng Fu, Licheng Wen +10LLM Agent MemoryRL for LLM Agents

  10. Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

    Jul 30, 2026Yash Pandya, Sahil Gupta, Sarthak Harne +10Computer-Use Agent BenchmarksComputer-Use Agents

  11. TAPO: Transition-Aware Policy Optimization for LLM Agents

    Jul 30, 2026Cong Li, Peixi Peng, Yisen Zhao +4Reinforcement LearningRL Post-Training

  12. Harness-G: A Graph-Structured Harness for Search Agents

    Jul 30, 2026Yanning Hou, Haoyuan Chen, Sihang Zhou +7Graph Retrieval-Augmented GenerationCredit Assignment in RL

  13. SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

    Jul 29, 2026Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan +5Agent Failure AnalysisLLM Agent Self-Improvement

  14. CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    Jul 28, 2026Yu Wang, Yi-Kai Zhang, Wentao Shi +8Reinforcement LearningGame-Playing Agents

  15. From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

    Jul 27, 2026Junlin Liu, Jiangwang Chen, Zixin Song +7Multi-Agent LLM SystemsAgentic Search

  16. MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents

    Jul 27, 2026Yiwen Ma, Songjun Tu, Qichao Zhang +3LLM Agent MemoryPersistent Memory for Language Models

  17. EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

    Jul 27, 2026Xiao Ma, Zhiquan Hu, Yi Wei +5Reinforcement LearningAgentic RAG

  18. Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

    Jul 24, 2026Siyuan Huang, Pengyu Cheng, Haotian Liu +10RL for Language Model ReasoningLLM Agent Skill Learning

  19. Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

    Jul 24, 2026Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi +7Retrieval-Augmented GenerationLLM Grounding

  20. OpenForgeRL: Train Harness-native Agents in Any Environment

    Jul 23, 2026Xiao Yu, Baolin Peng, Ruize Xu +7Computer-Use AgentsLLM Agent Training

  21. AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction

    Jul 23, 2026Qinfeng Li, Yuntai Bao, Xinyan Yu +7LLM Agent MemoryPolicy Learning

  22. Sample-Efficient Learning from Agent Experience

    Jul 23, 2026Chenhui Gou, Haoqin Tu, Yunhao Fang +2In-Context RLLanguage Model Distillation

  23. JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

    Jul 22, 2026Yuan Xiong, Linji Hao, Shizhu He +2AI Agent SafetyLLM Agent Safety

  24. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

    Jul 22, 2026Kaibing Yang, Guangfeng Cai, Shengtian Yang +6Group Relative Policy OptimizationRL Exploration

  25. AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

    Jul 19, 2026Yuejia Dou, Hesong Wang, Xinyu Zhang +6Automated BiddingLarge Language Model-Guided Optimization