RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. MDForge: Agentic Molecular Dynamics Pipeline Design under Sparse Simulator Feedback

    Jun 11, 2026Zehong Wang, Yijun Ma, Connor R. Schmidt +7AI Agents for Scientific DiscoveryMolecular Dynamics Simulation

  2. Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

    Jun 10, 2026Hongming Piao, Chi Liu, Mengzhuo Chen +5Deep Research AgentsLLM Agent Training

  3. Orchestra-o1: Omnimodal Agent Orchestration

    Jun 10, 2026Fan Zhang, Vireo Zhang, Shengju Qian +8LLM Agent OrchestrationGroup Relative Policy Optimization

  4. HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation

    Jun 10, 2026Haoran Liu, Yuwei Zhang, Xiyao Li +2Credit Assignment in RLOn-Policy Distillation

  5. INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

    Jun 9, 2026Ahasan Kabir, Jiaqi Xue, Mengxin Zheng +1Multi-Agent System OptimizationMulti-Agent Orchestration

  6. Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

    Jun 9, 2026João Coelho, João Magalhães, Bruno Martins +1Reinforcement LearningGroup Relative Policy Optimization

  7. HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

    Jun 9, 2026Juncheng Diao, Zhicong Lu, Peiguang Li +6Hierarchical RLLong-Horizon LLM Agents

  8. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL

  9. Co-Evolving Skill Generation and Policy Optimization

    Jun 7, 2026Zhiwei Zhang, Yudi Lin, Nikki Lijing Kuang +4LLM Agent Skill LearningRL for LLM Agents

  10. From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory

    Jun 7, 2026Yishuo Cai, Xingyu Guo, Xuancheng Huang +8Continual Learning for LLM AgentsLLM Agent Memory

  11. Self-evolving LLM agents with in-distribution Optimization

    Jun 5, 2026Yudi Zhang, Meng Fang, Zhenfang Chen +1Reinforcement LearningProcess Reward Models

  12. SCALE: Scalable Cross-Attention Learning with Extrapolation for Agentic Workflow Scheduling

    Jun 5, 2026Zhifei Xu, Jierui Lan, Zixuan Liang +2RL for LLM Agents

  13. When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

    Jun 4, 2026Yuanfan Li, Qi Zhou, Wenjing Duan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  14. Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

    Jun 3, 2026Dae Yon Hwang, Raunaq Suri, Valentin Villecroze +4Reinforcement LearningBayesian RL

  15. Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

    Jun 3, 2026Bo Mao, Jie Zhou, Yutao Yang +5Lifelong Learning AgentsLLM Agent Skill Learning

  16. Scaling Self-Evolving Agents via Parametric Memory

    Jun 3, 2026Tao Ren, Weiyao Luo, Hui Yang +8RL for LLM AgentsSelf-Evolving Agents

  17. Multi2^2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

    Jun 2, 2026Sangeun Park, Minhae KwonMulti-Agent LLM SystemsHierarchical RL

  18. InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain

    Jun 2, 2026Tiancheng Han, Yong Li, Wuzhou Yu +2Long-Context ModelingRL for LLM Agents

  19. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models

  20. Policy and World Modeling Co-Training for Language Agents

    Jun 1, 2026Ning Lu, Baijiong Lin, Shengcai Liu +9Agentic RLWorld Model Learning

  21. Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

    Jun 1, 2026Pengcheng Jiang, Zhiyi Shi, Kelly Hong +5Reinforcement LearningAgentic Retrieval

  22. SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

    Jun 1, 2026Zhongyu He, Yuanfan Li, Fei Huang +9LLM Agent Skill LearningLong-Horizon LLM Agents

  23. ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

    Jun 1, 2026Zelin He, Haotian Lin, Boran Han +6Reinforcement LearningLLM Agent Skill Learning

  24. HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

    May 31, 2026Yi Gu, Huacan Wang, Shuo Zhang +10AI Agent BenchmarksLLM Agent Training

  25. Learning to Retrieve: Dual-Level Long-Term Memory for Text-to-SQL Agents

    May 30, 2026Yibo Wang, Nikki Lijing Kuang, Philip S. Yu +2Text-to-SQLMemory-Augmented Agents

  26. Skill Reuse as Compression in Agentic RL

    May 29, 2026Zhikun Xu, Yu Feng, Jacob Dineen +3Agentic RLMinimum Description Length

  27. Task-Focused Memorization for Multimodal Agents

    May 29, 2026Tao Zou, Yichen He, Tian Qiu +2Continual Learning for LLM AgentsMultimodal Memory