RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

    Aug 7, 2026Jiacheng Miao, Jin Mu, Guanhua Chen +1AI Agent BenchmarksLLM Agent Training

  2. ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

    Aug 7, 2026Valentin Liévin, Samuel Schmidgall, Tim Strother +32Clinical Decision-MakingClinical Reasoning

  3. Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

    Aug 7, 2026Haoyu Zheng, Yun Zhu, Qing Wang +1Agentic RLCredit Assignment in RL

  4. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Token-Level Credit AssignmentCredit Assignment in RL

  5. MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents

    Aug 7, 2026Zhiyuan Liu, Tinghong Ye, Chenghao Liu +2On-Policy DistillationMemory-Augmented Agents

  6. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  7. CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

    Aug 6, 2026Wuya Chen, Yihao yang, Yang Cao +1AI Coding AgentsLLM Agent Workflow Optimization

  8. Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

    Aug 6, 2026Xiaofeng Wang, Kakam Chong, Shuai Xiao +9Reward ShapingHierarchical RL

  9. EvoHarness-RL: Learning Runtime Harness Coordination for Self-Evolving Agents

    Aug 5, 2026Xuying Ning, Dongqi Fu, Tianxin Wei +17Agent Harness OptimizationLong-Horizon Agent Tasks

  10. State2State: Environment-Derived Mid-Training for LLM Agents

    Aug 5, 2026Xuanyu Lei, Yiqi Zhu, Chenliang Li +6LLM Agent TrainingGoal-Conditioned RL

  11. Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

    Aug 5, 2026Yi Yang, Cong Qin, Xiaodan Liu +8Agentic RLOn-Policy Distillation

  12. E3^3-Orch: Towards Effective, Efficient, and Extensible Agentic Orchestration with Reinforcement Learning

    Aug 5, 2026Junnan Liu, Linhao Luo, Thuy-Trang Vu +1Multi-Agent OrchestrationLLM Agent Orchestration

  13. Group Perspective Matters: Regulating Debate Relationships Can Mitigate Blind Conformity in Multi-Agent Debate

    Aug 4, 2026Hao Wu, Shoucheng Song, Chang Yao +4Multi-Agent DebateRL for LLM Agents

  14. Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

    Aug 4, 2026Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich GabaLLM-Guided RLLong-Horizon LLM Agents

  15. Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

    Aug 4, 2026Siqi Fan, Minghao Li, Xiaoqian Ma +6Computer-Use AgentsRL for LLM Agents

  16. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Reward ShapingToken-Level Credit Assignment

  17. Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

    Aug 4, 2026Xiaolong Sun, Qichao Wang, Hangyu Li +1LLM Agent MemoryPersistent Memory for Language Models

  18. RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

    Aug 3, 2026Yi Yang, Zhennan Chen, Yihong Zhuang +5State AbstractionState Representation Learning

  19. Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

    Aug 3, 2026Zhiyuan Wang, Shengcai Liu, Jiahao Wu +5Evolutionary OptimizationEvolution Strategies

  20. Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

    Aug 3, 2026Shuai Shao, Kangning Zhang, Qingyao Li +7Agent Harness OptimizationLLM Agent Self-Improvement

  21. Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

    Aug 3, 2026Chishui Chen, Yaoyou Fan, Te Sun +11LLM Agent TrainingOn-Policy Distillation

  22. CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

    Aug 3, 2026Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai +6Knowledge Graph Question AnsweringKnowledge Graphs

  23. PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

    Aug 3, 2026Chunji Lv, Yangguang Wei, Junlin Liu +6Language Model DistillationOn-Policy Distillation

  24. SearchMaster: Grounded and Regulated Self-Play for Search Agents

    Aug 3, 2026Wentao Tan, Qiong Cao, Jiaqi Wang +1Multi-Hop QATool-Augmented Language Model Agents

  25. Progressive Agent Skill Generation via Reinforcement Learning

    Aug 3, 2026Junhao Shen, Zhanqiu Zhang, Yiwen Guo +1LLM Agent Skill LearningRL for LLM Agents

  26. Training Small LLMs as Spatial Multi-Agent Policies

    Aug 2, 2026Yi Mao, Andrew PerraultHierarchical RLMulti-Agent Collaboration