RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. Safe Equilibrium Policy Optimization for Strategic Agent Policies

    May 29, 2026Karthika Arumugam, Kiran Kumar Manku, Amit DhandaMulti-Agent System OptimizationGame-Playing Agents

  2. Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

    May 29, 2026Mustafa Anis Hussain, Xinle Wu, Yao LuDeep Research AgentsLLM Planning

  3. Learning Agent-Compatible Context Management for Long-Horizon Tasks

    May 29, 2026Lu Yi, Runlin Lei, Liuyi Yao +6Long-Horizon Agent TasksLLM Context Management

  4. SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

    May 28, 2026Yunbo Tang, Chengyi Yang, Shiyu Liu +4Agentic SearchRL for LLM Agents

  5. PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning

    May 28, 2026Qikai Chang, Zhenrong Zhang, Linbo Chen +4Multi-Objective Reinforcement LearningIntelligent Tutoring Systems

  6. Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design

    May 28, 2026Shengchao Chen, Ting Shu, Sufen RenLLM Agent Skill LearningPhysics-Informed ML

  7. STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments

    May 28, 2026Junyang Wang, Haiyang Xu, Xi Zhang +4GUI AgentsAI Agent Benchmarks

  8. GrepSeek: Training Search Agents for Direct Corpus Interaction

    May 28, 2026Alireza Salemi, Chang Zeng, Atharva Nijasure +4Tool-Augmented Language Model AgentsAgentic Search

  9. DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents

    May 28, 2026Rongsheng Zhang, Jiji Tang, Junnan Ren +6Large Language Model-Based Role-Play SimulationLong-Horizon Agent Evaluation

  10. PRO-CUA: Process-Reward Optimization for Computer Use Agents

    May 27, 2026Yifei He, Rui Yang, Hao Bai +2Reinforcement LearningProcess Reward Models

  11. DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

    May 27, 2026Jiamian Wang, Ruiyi Zhang, Tong Yu +5Multimodal IRMultimodal QA

  12. TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning

    May 27, 2026Chusen Li, Zhou Liu, Shuigeng Zhou +1Regret MinimizationMulti-Agent Reasoning

  13. ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay

    May 27, 2026Zhexin Hu, Li Wang, Xiaohan Wang +4LLM CompressionReinforcement Learning with Verifiable Rewards

  14. Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning

    May 27, 2026Wendi Li, Shawn Im, Sharon LiAgentic RLReinforcement Learning

  15. Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

    May 27, 2026Yibo Zhao, Zichen Ding, Jiayi Wu +2LLM AgentsInformation Retrieval

  16. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuCredit Assignment in RLStep-Level Credit Assignment in RL

  17. EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation

    May 26, 2026Yunbo Long, Haolang Zhao, Lukas Beckenbauer +2Multi-Agent NegotiationAutomated Negotiation

  18. Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

    May 26, 2026Xin Cheng, Shuo He, Lang Feng +4Group Relative Policy OptimizationCredit Assignment in RL

  19. UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

    May 26, 2026Yiqun Chen, Wei Yang, Erhan Zhang +14Multi-Agent LLM SystemsMulti-Agent System Optimization

  20. Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning

    May 25, 2026Wei Fan, Yining Zhou, Mufan Zhang +8Agentic SearchLegal QA

  21. ATOM: Instantiating Budget-Controllable Multi-Agent Collaboration via Nucleus-Electron Hierarchy

    May 25, 2026Xinkui Zhao, Sai Liu, Yifan Zhang +6Multi-Agent LLM SystemsMulti-Agent System Optimization

  22. CODESKILL: Learning Self-Evolving Skills for Coding Agents

    May 25, 2026Yanzhou Li, Yiran Zhang, Xiaoyu Zhang +2Coding AgentsLLM Agent Skill Learning

  23. Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS

    May 25, 2026Bingyu Yan, Xiaoming Zhang, Jinyu Hou +4Adversarial Attacks on LLMsLLM Agent Security

  24. ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents

    May 24, 2026Lei Ding, Bin He, Chenguang Wang +1Proactive AssistanceConversational Agents

  25. Test-Time Deep Thinking to Explore Implicit Rules

    May 24, 2026Wentong Chen, Xin Cong, Zhong Zhang +8RL for Language Model ReasoningLLM Agents

  26. CoRe-Code: Collaborative Reinforcement Learning for Code Generation

    May 24, 2026Zhihao Dou, Qinjian Zhao, Zhongwei Wan +2RL for Code GenerationMulti-Agent Coordination

  27. Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

    May 23, 2026Yuxin Zhang, Mengxue Hu, Zheng Lin +8LLM Agent TrainingLLM Routing