RL for LLM Agents

RL: Reinforcement Learning · LLM: Large Language Model

Momentum

70 papers in the last four weeks, up 141% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 402

All topics
CardsList
  1. HarnessSQL: Harness-Native Training for SQL Agents in Realistic Database Environments

    Oct 8, 2026Haolin Yang, Jipeng Zhang, Jian Xie +3Text-to-SQLLLM Agent Training

  2. Do LLMs Learn from Rewards in Context? : Rethinking the role of reward in In-Context Reinforcement Learning

    Oct 8, 2026Minchan Kwon, Seunghee Koh, Sunghyun Baek +2In-Context RLRL for LLM Agents

  3. Stochastic Teacher Intervention for Agentic On-Policy Distillation

    Oct 7, 2026Junnan Liu, Linhao Luo, Zhijun Chen +3On-Policy DistillationTeacher-Student Learning

  4. On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents

    Oct 7, 2026Aaron Wang, Neelabh Madan, Vlad Sobal +5Runtime Enforcement for AI AgentsLLM Agent Harnesses

  5. UniSkill: Learning Actor-Aligned Skill Proposals for an Evolving Policy

    Oct 7, 2026Yifei Lu, Cheng Liu, Dianzhi Yu +4LLM Agent Skill LearningAgent Skill Learning

  6. Learning to Accumulate Knowledge with Mutual Information

    Oct 7, 2026Yuyang Zhao, Lizi Liao, Leyang Shen +4Memory-Augmented Language Model AgentsRL for LLM Agents

  7. Training Advisors for LLM Agents from Task Outcomes

    Oct 7, 2026Sergei Polezhaev, Barys Liskavets, Ori Press +1LLM Agent TrainingRL for LLM Agents

  8. SkillForge: Co-Evolving Skills and Agents via Dynamic Skill Lifecycles

    Oct 7, 2026Yuyao Ge, Yiwei Wang, Yuchen He +5LLM Agent Skill LearningLLM Agents

  9. World Potential Model: Pretrained World Knowledge as Progress Potentials

    Oct 7, 2026Jun Zhao, Jixin Tang, Yang Shu +6Long-Horizon LLM AgentsRL for LLM Agents

  10. MIMESIS: Learning User Simulators as Training Environments for Interactive Agents

    Oct 7, 2026Hoang Phan, Dat Huynh, Andrey Zhmoginov +7User SimulationLLM Agent Training

  11. GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents

    Oct 6, 2026Bohan Lin, Liyi Chen, Zhuoning Guo +5LLM Agent TrainingOn-Policy Distillation

  12. VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents

    Oct 6, 2026Jiaju Chen, Min Yang, Jinghua Piao +4Token-Level Credit AssignmentCredit Assignment in RL

  13. RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

    Oct 5, 2026Sayak Chakrabarti, Sathish Reddy IndurthiGroup Relative Policy OptimizationCredit Assignment in RL

  14. MemPilot: Orchestrating On-Demand Multimodal Memory Curation for LLM Agents

    Oct 5, 2026Haozhen Zhang, Haodong Yue, Quanyu Long +6LLM Agent MemoryLLM Memory

  15. AMBER: Training Long-Horizon Web Agents through Append-Only Memory

    Oct 5, 2026Chinmay Savadikar, Zhaoyu Zhang, Mingyu Zhao +4Long-Horizon LLM AgentsAgent Memory Management

  16. Hierarchical Reinforcement Learning with Stable Temporal Abstraction for Language Model Agents

    Oct 4, 2026Shayan Mohajer Hamidi, Yize Cheng, Yuanda Xu +2Reinforcement LearningHierarchical RL

  17. Sibyl: An Efficient Small-large Model Collaboration Framework for Long-horizon Tasks

    Oct 4, 2026Zhewei Fang, Yuxin Zhang, Zhenwei Shao +8LLM Agent TrainingLong-Horizon LLM Agents

  18. Long-MDR: Long-Context Reinforcement Learning for Multimodal Deep-Research Agents

    Oct 4, 2026On Tai TangReinforcement LearningDeep Research Agents

  19. Beyond Instruction Following: Learning Grounded Skill-Following with Skill Contracts

    Oct 4, 2026Jianghan Shen, Zhenjie Liu, Yue Li +10Reinforcement LearningLLM Agent Skill Learning

  20. Do Your Own Research: Learning to Forecast by Learning to Search

    Oct 1, 2026Yusuf Afifi, Artur Kiulian, Anton Polishko +3Agentic RLForecasting Benchmarks

  21. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Agentic RLCredit Assignment in RL

  22. RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

    Oct 1, 2026Jingtan Wang, Sirajul Salekin, Young mok Jung +3Reinforcement LearningRubric-Based RL

  23. SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

    Sep 30, 2026Xinchen Du, Zhengze Zhou, Wenhui Zhu +4Agentic RLGroup Relative Policy Optimization

  24. PhantomEnvironments: Training LLM Agents in Fictional Worlds

    Sep 30, 2026Anmol Kabra, Swathi Saravana Selvam, Albert Gong +5Multi-Hop QAReinforcement Learning

  25. From Given to Gathered Evidence: Agentic Learning for Longitudinal Medical Reasoning

    Sep 30, 2026Minye Shao, Chaohui Yu, Yixuan Wu +3AI Agent BenchmarksMedical VLMs