RL for Tool Use

RL: Reinforcement Learning

Momentum

17 papers in the last four weeks, up 42% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 127

All topics
CardsList
  1. Self-Evolve With a Reference:Anchored Training of Tool-Integrated Agents

    Oct 7, 2026Wenjie Liao, Liangjie Zhao, Zehong CaoLLM Agent Self-ImprovementSelf-Evolving Agents

  2. CIPO: Counterfactual Imagination Policy Optimization for Adaptive Tool Granularity Selection

    Oct 4, 2026Yu Li, Yunlu Wan, Zijian Zhu +4LLM Agent Skill LearningRL for Tool Use

  3. HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents

    Sep 29, 2026Tongbo Chen, Junbo Niu, Zhengxi Lu +8Computer-Use AgentsGUI Agents

  4. Neuro-Symbolic Computer Use: Learning Reusable Policies for Reliable and Efficient Execution

    Sep 29, 2026Hyewon Suh, Thanh Minh Nguyen, Chih-Lun Lee +5Computer-Use AgentsRuntime Enforcement for AI Agents

  5. WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents

    Sep 29, 2026Bo Mao, Hang He, Linting Wang +17LLM Agent Self-ImprovementLLM Post-Training

  6. ParaAgent: Reinforcing Parallel Acting in Open-World Tool Environments

    Sep 27, 2026Shengbin Yue, Hongru Wang, Siyuan Wang +3LLM Agent TrainingTool Use

  7. SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

    Sep 24, 2026Yan Zhan, Shaobo Liu, Qiunan Liu +7Group Relative Policy OptimizationCredit Assignment in RL

  8. When Does Action Credit Need Updating?

    Sep 24, 2026Hongye Yang, Boxiao HuangCredit Assignment in RLCredit Assignment

  9. Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

    Sep 21, 2026Zixiang Chen, Wenting Zhao, Zhepeng Cen +9Reinforcement LearningCredit Assignment in RL

  10. MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards

    Sep 17, 2026Shihao Liu, Hao Yin, Lijun Liu +3Reward ModelingCurriculum RL

  11. SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale

    Sep 15, 2026Md Tahmid Rahman Laskar, Xue-Yong Fu, Shashi Bhushan TNSupervised Fine-TuningLLM Tool Use

  12. Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act

    Sep 14, 2026Yiwei Yang, Haoxiang Zhang, Bingbing Wen +6LLM Agent ReliabilityRL for Tool Use

  13. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Terminal AgentsLong-Horizon Agent Evaluation

  14. Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection

    Sep 9, 2026Haoyue Liu, Xiaoyu Ma, Ye Chen +2RL for Language Model ReasoningGroup Relative Policy Optimization

  15. Learning to Zoom Efficiently with a Contrastive Curriculum

    Sep 2, 2026Falko Helm, Iryna GurevychTool Use in VLMsContrastive RL

  16. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

    Sep 1, 2026Fanrui Zhang, Ruixue Ding, Qiang Zhang +13AI Agent BenchmarksRubric-Based RL

  17. CoBRA: Learning Tool-Use Boundaries via Counterfactual Margins

    Sep 1, 2026Wenhao Zou, Xianglong Liu, Wendong Bi +3Tool UseRL for Tool Use

  18. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

    Sep 1, 2026Xiaowei Sun, Jin Li, Yili Hong +2Cost-Aware InferenceConstrained RL

  19. One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning

    Aug 31, 2026Armin Dariani, Sifan Wu, Bang Liu +1LLM Tool UseTool Use

  20. Beyond Task Completion: Training Capable and Safe Computer-Use Agents

    Aug 27, 2026Zeyu Kang, Zhenyun Yin, Yang Zhang +5Computer-Use AgentsAI Agent Safety

  21. HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

    Aug 22, 2026Yucan Guo, Xiaohan Wang, Miao Su +8Credit AssignmentRL for LLM Agents

  22. SPADE: Self-Play in Adaptive Synthetic Executable Environments

    Aug 19, 2026Bo Liu, Simon Yu, Yiding Jiang +15Self-Play RLLLM Agent Self-Improvement

  23. RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

    Aug 19, 2026Yugu Li, Zehong Cao, Jianglin Qiao +1Agentic RLReinforcement Learning

  24. Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

    Aug 13, 2026Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3Token-Level Credit AssignmentStep-Level Credit Assignment in RL