RL for Tool Use

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 42% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 127

All topics
CardsList
  1. Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

    Aug 11, 2026Zelei Cheng, Amritansh Mishra, Sambit Sahu +1Efficient AttentionLong-Horizon Agent Tasks

  2. ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

    Aug 9, 2026Delin Mao, Chenghao Sun, Jingwei Song +2Tool Use in VLMsTool-Using Vision-Language Agents

  3. SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

    Aug 8, 2026Keyang Zhong, Kuo Wang, Peng Liu +5Temporal Video GroundingGroup Relative Policy Optimization

  4. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

    Aug 6, 2026Zishan Xu, Zhiyuan Yao, Yuxin Chen +9LLM World ModelsAgentic RL

  5. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

    Aug 4, 2026Changle Qu, Sunhao Dai, Hengyi Cai +4On-Policy Self-DistillationRL for Language Model Reasoning

  6. IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations

    Aug 3, 2026Dingwei Zhu, Jiahan Li, Chengjun Pan +22Tool-Using AgentsRobust RL

  7. CRISP: Critical Step Perception for Training Efficient Deep Search Agents

    Aug 3, 2026Haosi Mo, Zihao Yan, Ruiqing Zhang +4LLM AgentsLLM Agent Training

  8. HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

    Aug 3, 2026Haowei Liu, Jiamian Wang, Hsin-Tai Wu +2RL for Language ModelsAgentic Search

  9. SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

    Aug 1, 2026Tao Liu, Tao Feng, Xiangheng Li +9Reinforcement LearningText-to-SQL

  10. Cross-Benchmark Generalization in Long-Horizon Agents

    Jul 31, 2026Sushant Mehta, Logan Ritchie, Liudas Panavas +1Long-Horizon Agent EvaluationRL Post-Training

  11. Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

    Jul 28, 2026Fengxiang Wang, Jiangnan Huang, Mingshuo Chen +8Remote Sensing Image UnderstandingRemote Sensing VQA

  12. Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

    Jul 28, 2026Jiabao Ji, Yujian Liu, Li An +4Tool-Using AgentsLLM Agent Training

  13. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  14. Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

    Jul 24, 2026Siyuan Huang, Pengyu Cheng, Haotian Liu +10RL for Language Model ReasoningLLM Agent Skill Learning

  15. OpenForgeRL: Train Harness-native Agents in Any Environment

    Jul 23, 2026Xiao Yu, Baolin Peng, Ruize Xu +7Computer-Use AgentsLLM Agent Training

  16. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

    Jul 17, 2026Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu +5Tool-Use EvaluationAgentic RL

  17. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

    Jul 15, 2026Leitian Tao, Baolin Peng, Wenlin Yao +5Credit Assignment in RLStep-Level Credit Assignment in RL

  18. SPyCE: Skill-Policy Co-evolution for Multimodal Agents

    Jul 15, 2026Ru Zhang, Weijie QiuMultimodal ReasoningAgent Skill Learning

  19. From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

    Jul 7, 2026Yue Xu, Yutao Sun, Yihao Liu +7Persistent Memory for Language ModelsLong-Term Conversational Memory

  20. ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

    Jun 30, 2026Binjie Zhang, Mike Zheng ShouReinforcement LearningGroup Relative Policy Optimization

  21. TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

    Jun 29, 2026Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA

  22. An AI agent for treatment reasoning over a biomedical tool universe

    Jun 27, 2026Shanghua Gao, Ayush Noori, Richard Zhu +13Clinical Decision-MakingLLM Agent Training

  23. ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

    Jun 26, 2026ZhengXian Wu, Hangrui Xu, Kai Shi +8Multimodal RAGMultimodal Search Agents

  24. Localizing RL-Induced Tool Use to a Single Crosscoder Feature

    Jun 25, 2026Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani +3LLM InterpretabilityLLM Tool Use

  25. Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

    Jun 24, 2026Yupu Hao, Zhuoran Jin, Huanxuan Liao +2Supervised Fine-TuningLLM Reliability