RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. ECHO: Terminal Agents Learn World Models for Free

    May 23, 2026Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah +1World Model LearningComputer-Use Agents

  2. When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs

    May 22, 2026Yifan Zeng, Yiran Wu, Yaolun Zhang +4Multi-Agent LLM SystemsLLM Agent Workflow Optimization

  3. Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

    May 22, 2026Jiazheng Kang, Bowen Zhang, Zixin Song +4Deep Research AgentsAgentic Reasoning

  4. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  5. What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

    May 21, 2026Xinjie He, Zhiyuan Lin, Su Liu +4Memory-Augmented Neural NetworksCurriculum RL

  6. Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning

    May 21, 2026Banghao Chi, Yining Xie, Mingyuan Wu +9Tool-Using AgentsLLM Agent Training

  7. Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

    May 21, 2026Jinyang Wu, Guocheng Zhai, Ruihan Jin +7LLM Agent OrchestrationLanguage Model Ensembles

  8. Mem-ππ: Adaptive Memory through Learning When and What to Generate

    May 20, 2026Xiaoqiang Wang, Chao Wang, Hadi Nekoei +5LLM Agent MemoryRL for LLM Agents

  9. Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents

    May 20, 2026Chongrui Ye, Yuxiang Liu, Yu Wang +5Continual Learning for LLM AgentsContinual Learning

  10. Training Language Agents to Learn from Experience

    May 19, 2026Yuval Shalev, Zifeng Ding, Mateja JamnikContinual Learning for LLM AgentsSelf-Improving Agents

  11. Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

    May 19, 2026Wenjie Tang, Minne Li, Sijie Huang +2Reinforcement LearningPartially Observable RL

  12. Memory-Augmented Reinforcement Learning Agent for CAD Generation

    May 19, 2026Yin Xiaolong, Liu Yu, Shen Jiahang +4Text-to-CAD GenerationRL for Generative Models

  13. What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

    May 19, 2026Xiaozhe Li, Tianyi Lyu, Yang Li +6Reinforcement LearningCredit Assignment in RL

  14. Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints

    May 18, 2026Jiayu Li, Enpei Zhang, Dawei Zhou +2Sequential MARLSequential Decision Making

  15. PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

    May 18, 2026Wonjoong Kim, Yeonjun In, Sangwu Park +2Reward ModelingCredit Assignment in RL

  16. GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

    May 18, 2026Xiongbin Wu, Zhihao Luo, Shanzhe Lei +7Reinforcement LearningGroup Relative Policy Optimization

  17. HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

    May 18, 2026Zhi Li, Songkun Yan, Jie Cao +4Reinforcement LearningModel Calibration

  18. Look Before You Leap: Autonomous Exploration for LLM Agents

    May 15, 2026Ziang Ye, Wentao Shi, Yuxin Liu +6RL ExplorationLLM Agents

  19. ALSO: Adversarial Online Strategy Optimization for Social Agents

    May 15, 2026Xiang Li, Liping Yi, Mingze Kong +3Non-Stationary RLLarge Language Model-Based Social Simulation

  20. Response-Conditioned Parallel-to-Sequential Orchestration for Multi-Agent Systems

    May 15, 2026Nurbek Tastan, Alex Iacob, Lorenzo Sani +4Multi-Agent System OptimizationMulti-Agent Orchestration

  21. Self-Distilled Agentic Reinforcement Learning

    May 14, 2026Zhengxi Lu, Zhiyuan Yao, Zhuowen Han +8Agentic RLSelf-Distillation

  22. SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

    May 13, 2026Mingda Zhang, Tiesunlong Shen, Haoran Luo +4LLM Agent OrchestrationLLM Agent Self-Improvement

  23. Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging

    May 13, 2026Jiabei Liu, Wenyu Mao, Junfei Tan +4Multi-Hop QAAgentic RAG

  24. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  25. ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

    May 13, 2026Jianbo Lin, Xiaomin Yu, Yi Xin +7RL for Language ModelsLLM Self-Refinement

  26. Reinforced Collaboration in Multi-Agent Flow Networks

    May 13, 2026Zheng Wang, Yuang Liu, Yangkai DingMulti-Agent LLM SystemsMulti-Agent Collaboration

  27. Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

    May 12, 2026Zhong Guan, Yongjian Guo, Haoran Sun +5Asynchronous RLReinforcement Learning