Agentic RL

RL: Reinforcement Learning

Momentum

28 papers in the last four weeks, up 300% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 140

All topics
CardsList
  1. Libra: Efficient Resource Management for Agentic RL Post-Training

    Jun 2, 2026Kaiwen Chen, Xin Tan, Jingzong Li +6Agentic RLReinforcement Learning

  2. Policy and World Modeling Co-Training for Language Agents

    Jun 1, 2026Ning Lu, Baijiong Lin, Shengcai Liu +9Agentic RLWorld Model Learning

  3. Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

    Jun 1, 2026Liuji Chen, Dianxing Tang, Xing Shi +4Agentic RLRL for Language Model Reasoning

  4. RDA: Reward Design Agent for Reinforcement Learning

    Jun 1, 2026Hojoon Lee, Ajay Subramanian, Ben Abbatematteo +4Agentic RLReinforcement Learning

  5. Skill Reuse as Compression in Agentic RL

    May 29, 2026Zhikun Xu, Yu Feng, Jacob Dineen +3Agentic RLMinimum Description Length

  6. Agentic Transformers Provably Learn to Search via Reinforcement Learning

    May 29, 2026Tong Yang, Yu Huang, Yingbin Liang +1Policy GradientAgentic RL

  7. GUI-C2^2: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

    May 29, 2026Junlong Li, Chao Hao, Lap-Pui Chau +1Multimodal GroundingAgentic RL

  8. Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

    May 28, 2026Yuchen Liu, Yingjie Feng, Lixiong Qin +5Reward ModelingAgentic RL

  9. GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering

    May 28, 2026Xin Sun, Jianan Xie, Zhongqi Chen +6Agentic RLKnowledge Graph Question Answering

  10. Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

    May 27, 2026Jiapeng Zhu, Jianxiang Yu, Yibo Zhao +5Agentic RLOOD Generalization

  11. Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning

    May 27, 2026Wendi Li, Shawn Im, Sharon LiAgentic RLReinforcement Learning

  12. Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

    May 26, 2026Dingwei Chen, Zefang Zong, Zhipeng Ma +5Agentic RLLLM Agent Training

  13. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  14. ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

    May 19, 2026Zuhao Yang, Kaichen Zhang, Sudong Wang +7Tool Use in VLMsAgentic RL

  15. EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

    May 18, 2026Minrui Xu, Zilin Wang, Mengyi DENG +12Tool-Augmented Language Model AgentsAgentic RL

  16. AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

    May 15, 2026Haizhong Zheng, Yizhuo Di, Jiahui Wang +7Agentic RLReinforcement Learning

  17. Self-Distilled Agentic Reinforcement Learning

    May 14, 2026Zhengxi Lu, Zhiyuan Yao, Zhuowen Han +8Agentic RLSelf-Distillation

  18. Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

    May 14, 2026Minghao Wu, Yuting Yan, Zhenyang Cai +9Agentic RLClinical Decision Support

  19. Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

    May 14, 2026Langzhou He, Junyou Zhu, Yue Zhou +7Agentic RLToken-Level Credit Assignment

  20. ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

    May 12, 2026Xuhao Hu, Xi Zhang, Haiyang Xu +6Agentic RLRL for GUI Agents

  21. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  22. On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

    May 12, 2026Bo Yin, Qi Li, Xinchao WangAgentic RLLLM Safety Alignment

  23. Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning

    May 11, 2026Junhao Shen, Teng Zhang, Xiaoyan Zhao +1Agentic RLLLM Agent Skill Learning

  24. AHD Agent: Agentic Reinforcement Learning for Automatic Heuristic Design

    May 9, 2026Haoze Lv, Ning Lu, Ziang Zhou +1Agentic RLAutomated Heuristic Design

  25. StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

    May 7, 2026Xiangyuan Xue, Yifan Zhou, Zidong Wang +5Agentic RLHierarchical RL

  26. Recursive Agent Optimization

    May 7, 2026Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang +2Agentic RLInference-Time Scaling