RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training

    Sep 27, 2026Xinyu Che, Hang Yan, Yanchen Liu +5World Model LearningRL Post-Training

  2. Learning to Sell: Reinforcement Learning for Strategic Large Language Model Agents in Multi-Product Markets

    Sep 27, 2026Shuze Daniel Liu, Claire Chen, Jiuqi Wang +2Multi-Agent NegotiationAutomated Negotiation

  3. IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis

    Sep 24, 2026Xingyu Wu, Yuchen Yan, Zhengxi Lu +9Long-Horizon LLM AgentsRL for LLM Agents

  4. Rufus-Air: An Open LLM Post-Training Recipe

    Sep 24, 2026Chia-Yuan Chang, Renyuan Cheng, Rui Feng +19LLM Fine-TuningRL for Language Model Reasoning

  5. From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents

    Sep 24, 2026Xingyu Su, Abhishek Kumar, Qing Ping +5On-Policy Self-DistillationLLM Agent Training

  6. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

    Sep 24, 2026Xincheng Yao, Haobo Fu, Weiming Liu +1Agentic RLCredit Assignment in RL

  7. TRACER: Trajectory-Aligned Learning for Multi-Turn User Simulation

    Sep 23, 2026Geng Chen, Ruotong Pan, Zhirui Yang +9AI Agent BenchmarksUser Simulation

  8. Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents

    Sep 23, 2026Zheng Zhang, Liu Liu, Qi Chai +4Large Language Model-Based Role-Play SimulationAdversarial Scenario Generation

  9. SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving

    Sep 23, 2026Zhilong Ge, Yuting Shao, Yutao Yang +6Tool-Augmented Language Model AgentsLLM Agent Skill Learning

  10. ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

    Sep 23, 2026Ming Ma, Yi Zhu, Yiran Zhong +7Agentic RLCredit Assignment in RL

  11. MemCalib: Benchmarking and Optimizing Memory Use in LLM Agents

    Sep 21, 2026Ruike Cao, Fanyu Zhao, Fugen Yao +5LLM Agent MemoryMemory Agent Benchmarks

  12. RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

    Sep 17, 2026Yan Yu, Zhengxi Lu, Yizhou Liu +7Agentic RLOn-Policy Distillation

  13. Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

    Sep 17, 2026Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan +2Supervised Fine-TuningReinforcement Learning

  14. Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass Normalization

    Sep 17, 2026Yingxuan Zhuang, Binhe Yu, Jingxiao Yang +6Group Relative Policy OptimizationPolicy Optimization

  15. DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum

    Sep 17, 2026Haoqiang Kang, Yiming Zhang, Yiyang Guo +5Long-Horizon PlanningLong-Horizon Agent Evaluation

  16. CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents

    Sep 16, 2026Jiaxuan Jiang, Liyuan He, Zhixuan FangContinual Learning for LLM AgentsMulti-Agent Systems

  17. Interactive Memory Learning for Long-Term Conversations

    Sep 15, 2026Cai Ke, Jiangyue Yan, Han Zhang +5Multi-Agent LLM SystemsLong-Term Conversational Memory

  18. Assembling the CREW: A Collaborative Multi-agent Reinforcement Learning Framework for Automated Related Work Generation

    Sep 14, 2026Hai-Dang Dang, Bao-Yen Pham, Bao Nguyen +2Multi-Agent LLM SystemsRL for LLM Agents

  19. Salesforce Koa: An Enterprise Language Model for Agentic Tool Use

    Sep 14, 2026Zixiang Chen, Sufeng Niu, Yingchi Liu +23Tool-Augmented Language Model AgentsLanguage Modeling

  20. VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets

    Sep 14, 2026Yu Bai, Yukai Miao, Dawei Wang +8RL BenchmarksReinforcement Learning

  21. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Terminal AgentsLong-Horizon Agent Evaluation

  22. Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

    Sep 11, 2026Taoran Liang, Yang Liu, Shang Luo +10Credit Assignment in RLStep-Level Credit Assignment in RL

  23. BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL

    Sep 9, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +3Asynchronous RLOff-Policy RL

  24. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

    Sep 8, 2026Hongbang Yuan, Zhuoran Jin, Yixin CaoReinforcement LearningSparse-Reward RL

  25. What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

    Sep 7, 2026Chenqian Le, Jiayi Cheng, Qijia He +3RL for Code GenerationGroup Relative Policy Optimization

  26. Iris: Climbing to the Search Frontier

    Sep 3, 2026Ziyuan Liu, Hengqi Liu, Zichuan Wang +8Multi-Hop QAWeb Search Agents