Agentic RL

RL: Reinforcement Learning

Momentum

28 papers in the last four weeks, up 300% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 140

All topics
CardsList
  1. Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

    Jul 15, 2026Xiaopeng Zhang, Yueyang Weng, Qi Liu +2Agentic RLRobot Failure Recovery

  2. Mach-Mind-4-Flash Technical Report

    Jul 10, 2026Foundation Model TeamAgentic RLToken Efficiency

  3. Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

    Jul 8, 2026Zhenyu Hou, Yujiang Li, Jie Tang +1Agentic RLAsynchronous RL

  4. RLVP: Penalize the Path, Reward the Outcome

    Jul 8, 2026Bojie Li, Noah ShiAgentic RLConstrained RL

  5. Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

    Jul 8, 2026Zetian Hu, Shunyu Liu, Junjie Zhang +4Agentic RLGroup Relative Policy Optimization

  6. Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

    Jul 7, 2026Akshay Arora, Ishan Nigam, Ashutosh Aggarwal +6Agentic RLAI Agent Evaluation

  7. Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

    Jul 4, 2026Haochen Luo, Yi Huang, Sichun Luo +5Agentic RLAgent Harness Optimization

  8. TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

    Jun 30, 2026Yuanda Xu, Zhengze Zhou, Hejian Sang +6Agentic RLStep-Level Credit Assignment in RL

  9. ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

    Jun 30, 2026Zijun Xie, Binbin Zheng, Enlei Gong +7Agentic RLCredit Assignment in RL

  10. ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents

    Jun 26, 2026Qitai Tan, Zefang Zong, Yang Li +1Agentic RLOn-Policy Distillation

  11. OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

    Jun 25, 2026Shuo Yang, Jinyang Wu, Zhengxi Lu +8Agentic RLLLM Agent Skill Learning

  12. Qwen-AgentWorld: Language World Models for General Agents

    Jun 23, 2026Yuxin Zuo, Zikai Xiao, Li Sheng +30LLM World ModelsAgentic RL

  13. Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

    Jun 22, 2026Yunan Wang, Minghui Song, Zihan Zhang +6Agentic RLReinforcement Learning

  14. Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

    Jun 18, 2026Yuexing Hao, Xiaomin LiAgentic RLComputer-Use Agents

  15. StepGuard: Guarding Web Navigation via Single-Step Calibration

    Jun 16, 2026Zhihao Cui, Yuchen Zhang, Xiyang Sun +6Agentic RLReinforcement Learning

  16. EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

    Jun 16, 2026Zhitong Wang, Songze Li, Hao Peng +4Agentic RLWorld Model Learning

  17. From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

    Jun 11, 2026Rongxin Yang, Shenghong He, Siyuan Zhu +1Agentic RLProcess Reward Models

  18. APPO: Agentic Procedural Policy Optimization

    Jun 10, 2026Xucong Wang, Ziyu Ma, Yong Wang +5Agentic RLCredit Assignment in RL

  19. UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning

    Jun 10, 2026Haoyuan Deng, Yitong Gao, Yudong Lin +3Agentic RLReinforcement Learning

  20. The Artificial Experimentalist: Discovery and Control of Self-Organizing Phenomena with Autotelic Reinforcement Learning

    Jun 10, 2026Marko Cvjetko, Benedikt Hartl, Michael Levin +2Agentic RLReinforcement Learning

  21. Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

    Jun 8, 2026Daoyu Wang, Mingyue Cheng, Qingchuan Li +3Agentic RLReinforcement Learning

  22. HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning

    Jun 7, 2026Zechu Li, Yufeng Jin, Xiaoyang Liu +4Agentic RLReinforcement Learning

  23. EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management

    Jun 2, 2026Zherui Yang, Fan Liu, Yansong Ning +1Agentic RLLLM Agent Skill Learning

  24. Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

    Jun 2, 2026Hongye Cao, Nuo Yan, Haoyuan Deng +5Agentic RLRL for Language Model Reasoning

  25. EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

    Jun 2, 2026Guhong Chen, Yingcheng Shi, Yongbin Li +6RL for Code GenerationAgentic RL