Tool-Use Evaluation

Momentum

12 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 66

All topics
CardsList
  1. Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills

    Oct 1, 2026Ngoc Phuoc An Vo, Aarya Doshi, Vadim SheininTool-Use EvaluationAI Agent Evaluation

  2. EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

    Sep 30, 2026Shulin Tian, Junsu Kim, Shuai Liu +17Tool-Use EvaluationTool Use in VLMs

  3. Do Agent Benchmarks Do What They Say? An Executable-Contract Audit of Tool-Using Agent Environments

    Sep 29, 2026Rohith Reddy Bellibatlu, Zichong Wang, Wenbin ZhangTool-Use EvaluationAutomated Software Testing

  4. Interface-Induced Trajectory Censoring

    Sep 3, 2026Wenbo WangTool-Use EvaluationAI Agent Evaluation

  5. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

    Sep 1, 2026Kangjia Zhao, Jiajun Li, Haozhan Shen +8Tool-Use EvaluationLLM Agent Evaluation

  6. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

    Aug 31, 2026Wei Chen, Peilun Zhou, Zhaoyu Hu +8Tool-Use EvaluationLLM Agent Evaluation

  7. Source-Dependent Deference in Medical Imaging Agents Under Falsified Findings: A Pilot Audit

    Aug 30, 2026Ridam Roy, Md Shahriar Rashid, Md. Rajib MiaTool-Use EvaluationMedical VQA

  8. VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

    Aug 12, 2026Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder +6Tool-Use EvaluationAI Agent Benchmarks

  9. UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

    Aug 10, 2026Xuexiong Yin, Zechuan Chen, Yongsen Zheng +5Tool-Use EvaluationTool-Augmented Language Model Agents

  10. Epistemic Transfer in AI-Assisted Verification: A Framework and Evaluation Protocol

    Aug 9, 2026Christoph TrattnerTool-Use EvaluationHuman-in-the-Loop Evaluation

  11. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

    Aug 9, 2026Dongjie Xu, Julius, Hanchi Dong +6LLM EvaluationTool-Use Evaluation

  12. OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

    Aug 9, 2026Changhao Xiang, Shilin Zhang, Zheng Ma +8Tool-Use EvaluationTool Use in VLMs

  13. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Tool-Use EvaluationAI Agent Auditing

  14. When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

    Aug 6, 2026Xiaoqing Wu, Xingyu Fan, Feifei Li +1Tool-Use EvaluationLLM Tool Use

  15. Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

    Aug 4, 2026S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh +1LLM EvaluationTool-Use Evaluation

  16. TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

    Jul 29, 2026Jinhu Qi, Wentao Zhang, Siu Man Ng +4Tool-Use EvaluationLLM Agent Evaluation

  17. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

    Jul 26, 2026Weihuang Zheng, Tianyuan Zou, Eileen Ye +5Computer-Use Agent BenchmarksTool-Use Evaluation

  18. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

    Jul 17, 2026Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu +5Tool-Use EvaluationAgentic RL

  19. MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

    Jul 16, 2026Huanxi Liu, Kun Hu, Jiaqi Liao +6Tool-Use EvaluationAI Agent Benchmarks

  20. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1Computer-Use Agent BenchmarksAI for Science

  21. ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents

    Jun 26, 2026Shijing Hu, Liang Liu, Zhu Meng +1Privacy AuditingTool-Use Evaluation

  22. Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

    Jun 19, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +5AI Agent ReliabilityTool-Use Evaluation

  23. ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

    Jun 13, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  24. Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

    Jun 5, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  25. ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

    Jun 4, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  26. Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery

    Jun 3, 2026Arquimedes Canedo, Grama ChethanLLM Self-CorrectionTool-Use Evaluation

  27. Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

    Jun 2, 2026Xuan Yang, Hao Xu, Tingfeng Hui +4LLM EvaluationTool-Use Evaluation

  28. Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

    Jun 1, 2026Garvin Guo, Donglei Yu, Yu Chen +6Tool-Use EvaluationLLM Agent Evaluation

  29. On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

    May 28, 2026Tong Liu, Cheng Qian, Matej Cief +4Tool-Use EvaluationLLM Agent Evaluation

  30. A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

    May 27, 2026Tomer Keren, Nitay Calderon, Asaf Yehudai +3Computer-Use Agent BenchmarksTool-Use Evaluation

  31. AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

    May 27, 2026Kou Shi, Ziao Zhang, Shiting Huang +7Tool-Use EvaluationAI Agent Benchmarks

  32. Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

    May 25, 2026Tianda Sun, Dimitar KazakovTool-Use EvaluationReinforcement Learning

  33. How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

    May 23, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh +1Tool-Use EvaluationTool-Augmented Language Model Agents

  34. SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

    May 21, 2026Shuaiqi Wang, Aadyaa Maddi, Zinan Lin +1Tool-Use EvaluationLLM Agent Evaluation

  35. TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

    May 16, 2026Zhiqiang Liu, Wenhui Dong, Yilang Tan +3Tool-Use EvaluationAI Agent Benchmarks

  36. An Executable Benchmarking Suite for Tool-Using Agents

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jiamin Wang +1Computer-Use Agent BenchmarksTool-Use Evaluation

  37. TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

    May 10, 2026Yize Li, Junzhi Li, Jason Song +3LLM EvaluationTool-Use Evaluation

  38. To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

    May 1, 2026Qinyuan Wu, Soumi Das, Mahsa Amani +5Tool-Use EvaluationLLM Tool Use