Tool-Use Evaluation

Momentum

12 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 67

All topics
CardsList
  1. GeoNatureAgent (GNA): A Framework and Benchmark for Pre-Production Evaluation of Tool-Using Agents on Geospatial and Environmental Tasks

    Oct 6, 2026Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces +3Tool-Use EvaluationLLM Agent Evaluation

  2. Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills

    Oct 1, 2026Ngoc Phuoc An Vo, Aarya Doshi, Vadim SheininTool-Use EvaluationAI Agent Evaluation

  3. EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

    Sep 30, 2026Shulin Tian, Junsu Kim, Shuai Liu +17Tool-Use EvaluationTool Use in VLMs

  4. Do Agent Benchmarks Do What They Say? An Executable-Contract Audit of Tool-Using Agent Environments

    Sep 29, 2026Rohith Reddy Bellibatlu, Zichong Wang, Wenbin ZhangTool-Use EvaluationAutomated Software Testing

  5. Interface-Induced Trajectory Censoring

    Sep 3, 2026Wenbo WangTool-Use EvaluationAI Agent Evaluation

  6. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

    Sep 1, 2026Kangjia Zhao, Jiajun Li, Haozhan Shen +8Tool-Use EvaluationLLM Agent Evaluation

  7. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

    Aug 31, 2026Wei Chen, Peilun Zhou, Zhaoyu Hu +8Tool-Use EvaluationLLM Agent Evaluation

  8. Source-Dependent Deference in Medical Imaging Agents Under Falsified Findings: A Pilot Audit

    Aug 30, 2026Ridam Roy, Md Shahriar Rashid, Md. Rajib MiaTool-Use EvaluationMedical VQA

  9. VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

    Aug 12, 2026Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder +6Tool-Use EvaluationAI Agent Benchmarks

  10. UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

    Aug 10, 2026Xuexiong Yin, Zechuan Chen, Yongsen Zheng +5Tool-Use EvaluationTool-Augmented Language Model Agents

  11. Epistemic Transfer in AI-Assisted Verification: A Framework and Evaluation Protocol

    Aug 9, 2026Christoph TrattnerTool-Use EvaluationHuman-in-the-Loop Evaluation

  12. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

    Aug 9, 2026Dongjie Xu, Julius, Hanchi Dong +6LLM EvaluationTool-Use Evaluation

  13. OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

    Aug 9, 2026Changhao Xiang, Shilin Zhang, Zheng Ma +8Tool-Use EvaluationTool Use in VLMs

  14. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Tool-Use EvaluationAI Agent Auditing

  15. When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

    Aug 6, 2026Xiaoqing Wu, Xingyu Fan, Feifei Li +1Tool-Use EvaluationLLM Tool Use

  16. Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

    Aug 4, 2026S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh +1LLM EvaluationTool-Use Evaluation

  17. TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

    Jul 29, 2026Jinhu Qi, Wentao Zhang, Siu Man Ng +4Tool-Use EvaluationLLM Agent Evaluation

  18. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

    Jul 26, 2026Weihuang Zheng, Tianyuan Zou, Eileen Ye +5Computer-Use Agent BenchmarksTool-Use Evaluation