Tool-Use Evaluation

Momentum

12 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 67

All topics
CardsList
  1. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

    Jul 17, 2026Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu +5Tool-Use EvaluationAgentic RL

  2. MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

    Jul 16, 2026Huanxi Liu, Kun Hu, Jiaqi Liao +6Tool-Use EvaluationAI Agent Benchmarks

  3. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1Computer-Use Agent BenchmarksAI for Science

  4. ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents

    Jun 26, 2026Shijing Hu, Liang Liu, Zhu Meng +1Privacy AuditingTool-Use Evaluation

  5. Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

    Jun 19, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +5AI Agent ReliabilityTool-Use Evaluation

  6. ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

    Jun 13, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  7. Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

    Jun 5, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  8. ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

    Jun 4, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  9. Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery

    Jun 3, 2026Arquimedes Canedo, Grama ChethanLLM Self-CorrectionTool-Use Evaluation

  10. Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

    Jun 2, 2026Xuan Yang, Hao Xu, Tingfeng Hui +4LLM EvaluationTool-Use Evaluation

  11. Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

    Jun 1, 2026Garvin Guo, Donglei Yu, Yu Chen +6Tool-Use EvaluationLLM Agent Evaluation

  12. On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

    May 28, 2026Tong Liu, Cheng Qian, Matej Cief +4Tool-Use EvaluationLLM Agent Evaluation

  13. A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

    May 27, 2026Tomer Keren, Nitay Calderon, Asaf Yehudai +3Computer-Use Agent BenchmarksTool-Use Evaluation

  14. AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

    May 27, 2026Kou Shi, Ziao Zhang, Shiting Huang +7Tool-Use EvaluationAI Agent Benchmarks

  15. Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

    May 25, 2026Tianda Sun, Dimitar KazakovTool-Use EvaluationReinforcement Learning

  16. How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

    May 23, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh +1Tool-Use EvaluationTool-Augmented Language Model Agents

  17. SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

    May 21, 2026Shuaiqi Wang, Aadyaa Maddi, Zinan Lin +1Tool-Use EvaluationLLM Agent Evaluation

  18. TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

    May 16, 2026Zhiqiang Liu, Wenhui Dong, Yilang Tan +3Tool-Use EvaluationAI Agent Benchmarks

  19. An Executable Benchmarking Suite for Tool-Using Agents

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jiamin Wang +1Computer-Use Agent BenchmarksTool-Use Evaluation

  20. TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

    May 10, 2026Yize Li, Junzhi Li, Jason Song +3LLM EvaluationTool-Use Evaluation

  21. To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

    May 1, 2026Qinyuan Wu, Soumi Das, Mahsa Amani +5Tool-Use EvaluationLLM Tool Use