RL for Tool Use

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 42% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 127

All topics
CardsList
  1. Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

    Jun 23, 2026Marta Sumyk, Oleksandr KosovanRL for GUI AgentsRL Fine-Tuning

  2. SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

    Jun 22, 2026Yizhang Zhu, Zhangyang Peng, Boyan Li +1Text-to-SQLRL for Tool Use

  3. Self-Evolution for Multi-Turn Tool-Calling Agents via Divergence-Point Preference Learning

    Jun 22, 2026Jiaqiang TangTool-Using AgentsSelf-Improving Agents

  4. RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents

    Jun 17, 2026Ruishan Fang, Siyuan Lu, Chenyi Zhuang +1Synthetic Data GenerationSample-Efficient RL

  5. PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents

    Jun 15, 2026Zhenbang Du, Jun Luo, Zhiwei Zheng +8Learning from DemonstrationLLM Agent Training

  6. Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

    Jun 15, 2026Junyi Li, Xiaowei Qian, Yingyi Zhang +6Multi-Objective Reinforcement LearningMulti-Objective Language Model Alignment

  7. CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

    Jun 12, 2026Md Amirul Islam, Sumiran Thakur, Huancheng Chen +3LLM Agent TrainingTool-Using Language Agents

  8. SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

    Jun 11, 2026Ziyi Wang, Yuxuan Lu, Yimeng Zhang +8AI Agent ReliabilityReinforcement Learning

  9. APPO: Agentic Procedural Policy Optimization

    Jun 10, 2026Xucong Wang, Ziyu Ma, Yong Wang +5Agentic RLCredit Assignment in RL

  10. IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

    Jun 10, 2026Yifan Yang, Zhen Zhang, Jiayi Tian +2Tool Use in VLMsReinforcement Learning

  11. HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation

    Jun 10, 2026Haoran Liu, Yuwei Zhang, Xiyao Li +2Credit Assignment in RLOn-Policy Distillation

  12. Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

    Jun 5, 2026Yijin Zhou, Linqian Zeng, Xiaoya Lu +4Reinforcement LearningLLM Uncertainty Estimation

  13. TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents

    Jun 4, 2026Chengqi Dong, Chuhuai Yue, Hang He +6Multimodal IRToken-Level Credit Assignment

  14. SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

    Jun 3, 2026Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang +7Process Reward ModelsScientific Reasoning

  15. Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

    Jun 2, 2026Hongye Cao, Nuo Yan, Haoyuan Deng +5Agentic RLRL for Language Model Reasoning

  16. RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

    Jun 2, 2026Xian Qi Loye, Qinglin Su, Zhexin Zhang +5Reinforcement LearningAI Agent Safety

  17. Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

    Jun 1, 2026Liuji Chen, Dianxing Tang, Xing Shi +4Agentic RLRL for Language Model Reasoning

  18. MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand

    Jun 1, 2026Shouang Wei, Houcheng Min, Xinpeng Dong +8LLM Agent Skill LearningMultimodal Agents

  19. SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

    May 30, 2026Qiming Shi, Zhaolu Kang, Yunfan Zhou +2Credit Assignment in RLStep-Level Credit Assignment in RL

  20. On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

    May 28, 2026Tong Liu, Cheng Qian, Matej Cief +4Tool-Use EvaluationLLM Agent Evaluation

  21. DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning

    May 28, 2026Yang He, Xiao Ding, Bibo Cai +5Reinforcement LearningRL for Language Model Reasoning

  22. Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

    May 26, 2026Dingwei Chen, Zefang Zong, Zhipeng Ma +5Agentic RLLLM Agent Training

  23. Mind the Tool Failures: Achieving Synergistic Tool Gains for Medical Agents

    May 26, 2026Yunhui Gan, Tan Pan, Kaiyu Guo +5Tool UseRL for Tool Use

  24. Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

    May 25, 2026Tianda Sun, Dimitar KazakovTool-Use EvaluationReinforcement Learning