AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

    May 21, 2026Asaf Yehudai, Lilach Eden, Michal Shmueli-ScheuerLLM Agent EvaluationAI Agent Benchmarks

  2. TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

    May 21, 2026Zhaoyang Chu, Jiarui Hu, Xingyu Jiang +8Computer-Use Agent BenchmarksTerminal Agents

  3. Towards Direct Evaluation of Harness Optimizers via Priority Ranking

    May 21, 2026Kai Tzu-iunn Ong, Minseok Kang, Dongwook Choi +11AI Agent EvaluationAgent Harness Optimization

  4. AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

    May 21, 2026Zi Ye, Yibin Wen, Xiaoya Fan +10AI Agent BenchmarksTool-Using Vision-Language Agents

  5. Cross-domain benchmarks reveal when coordinated AI agents improve scientific inference from partial evidence

    May 21, 2026Fiona Y. Wong, Markus J. BuehlerAI for ScienceMulti-Agent Coordination

  6. SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval

    May 21, 2026Ningyuan Li, Haiyang Shen, Mugeng Liu +4Web Search AgentsAI Agent Benchmarks

  7. Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems

    May 20, 2026Deepak Panigrahy, Aakash TyagiLLM Agent OrchestrationAgentic Workflows

  8. SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?

    May 20, 2026Kevin Han, Renfei Zhang, Kathy Wei +3LLM Agent EvaluationAI Agent Benchmarks

  9. What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

    May 20, 2026Mahdi Naser Moghadasi, Faezeh GhaderiBenchmark AuditingLLM Auditing

  10. Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

    May 20, 2026Amit Roth, Ankur Samanta, Matan Halevy +2Reward HackingAI Agent Benchmarks

  11. Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines

    May 20, 2026Alimurtaza Mustafa Merchant, Krish Veera, Sajal Kumar Goyla +3LLM Agent OrchestrationAgentic Workflows

  12. The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents

    May 19, 2026Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar +3VLM RobustnessLarge Language Model-Based Robot Planning

  13. AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

    May 19, 2026Parsa Mazaheri, Kasra MazaheriAgent Failure AnalysisComputer-Use Agent Benchmarks

  14. WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

    May 19, 2026Bingnan Liu, Chenhang Cui, Rui Huang +7VLM EvaluationAI Agent Benchmarks

  15. Synthesis and Evaluation of Long-term History-aware Medical Dialogue

    May 19, 2026Hebin Hu, Renke Dai, Ah-Hwee Tan +1HealthcareAI Agent Benchmarks

  16. CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing

    May 19, 2026Haobo Hu, Xiangwu Guo, Zhiheng Chen +4GUI AgentsVideo Editing

  17. Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

    May 18, 2026Leyao Wang, Yanan He, Peng Chen +5AI Agent ReliabilityLLM-as-a-Judge

  18. How Far Are We From True Auto-Research?

    May 18, 2026Zhengxin Zhang, Ning Wang, Sainyam Galhotra +1LLM Agent EvaluationAI Agent Benchmarks

  19. DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

    May 18, 2026Yuxuan Gao, Megan Wang, Yi Ling Yu +2LLM Agent OrchestrationLong-Horizon Agent Evaluation

  20. ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

    May 18, 2026Yining Hong, Jiageng Liu, Han Yin +5Active PerceptionSpatial Reasoning Benchmarks

  21. SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

    May 18, 2026Yifan Zhou, Zhentao Zhang, Ziming Cheng +8LLM Agent EvaluationLLM Agent Skill Learning

  22. MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

    May 18, 2026Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh +3Agent MemoryLong-Horizon Agent Evaluation

  23. STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

    May 18, 2026Tingfeng Hui, Hao Xu, Pengyu Zhu +5Spatiotemporal ReasoningLLM Planning

  24. EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

    May 18, 2026Yuyao Wang, Zhongjian Zhang, Mo Chi +7LLM Agent MemoryLLM Agent Evaluation

  25. DocOS: Towards Proactive Document-Guided Actions in GUI Agents

    May 18, 2026Jingjing Liu, Ziye Huang, Zihao Cheng +6GUI AgentsWeb Search Agents