AI Agent Benchmarks

Momentum

146 papers in the last four weeks, up 161% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

    Jun 26, 2026Shoufa Chen, Luyuan Wang, Xuan Yang +7Computer-Use Agent BenchmarksComputer-Use Agents

  2. NormAct: A Benchmark for Hidden Social Norm Compliance in Embodied Planning

    Jun 26, 2026Shiyun Zhao, Xinwei Song, Tianyu Guo +7AI Agent BenchmarksMultimodal Agents

  3. When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search

    Jun 26, 2026Yiling Tao, Shihan Deng, Meiling Tao +3Agentic SearchLLM Agent Evaluation

  4. OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

    Jun 25, 2026Aoyang Fang, Yifan Yang, Jin'ao Shang +7LLM Agent EvaluationCausal Attribution

  5. How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

    Jun 24, 2026David Akinpelu, Akintonde Abbas, Rereloluwa Alimi +1LLM Agent EvaluationAI Agent Benchmarks

  6. RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments

    Jun 24, 2026Babak Rahmani, Sebastian Dziadzio, Joschka Strüber +2Opponent ModelingLLM-Based Program Synthesis

  7. Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

    Jun 24, 2026Yang Tian, Zhengpeng Shi, Yu Zhou +1AI Agent ReliabilityAI Agent Benchmarks

  8. Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

    Jun 24, 2026Divake Kumar, Sina Tayebati, Devashri Naik +5Computer-Use Agent BenchmarksUncertainty Quantification

  9. SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

    Jun 24, 2026Yeqi Feng, Yuxin Chen, Tianxing HeMulti-Agent NegotiationGame Theory

  10. BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding

    Jun 24, 2026Yangxuan Zhou, Sha Zhao, Jiquan Wang +2Multi-Agent LLM SystemsBrain-Computer Interfaces

  11. EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

    Jun 23, 2026Zhiyuan Peng, Xin Yin, Chenhao Ying +5Computer-Use Agent BenchmarksLLM Agent Self-Improvement

  12. MemAudit: Auditing Long-Term Agent Memory via Hidden User-State Recovery

    Jun 23, 2026Enze Ma, Yufan Zhou, Wei-Chieh Huang +7Agent MemoryAI Agent Benchmarks

  13. NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

    Jun 23, 2026Yuru Wang, Lejun Cheng, Yuxin Zuo +14AI for ScienceCoding Agents

  14. SP-Mind: An Autonomous Reasoning Agent for Spatial Proteomics Analysis

    Jun 23, 2026Yucheng Yuan, Yuanfeng Ji, Zhongxiao Li +1AI Agent BenchmarksTool-Using Agents

  15. MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

    Jun 23, 2026Jinru Ding, Chuchu Jiang, Lu Lu +12AI Agent BenchmarksMedical VLMs

  16. MAS-PromptBench: When Does Prompt Optimization Improve Multi-Agent LLM Systems?

    Jun 22, 2026Juyang Bai, Laixi ShiMulti-Agent LLM SystemsMulti-Agent System Optimization

  17. EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning

    Jun 22, 2026Yitong Qiao, Lei Liu, Yue Shen +4AI Agent BenchmarksClinical Reasoning

  18. StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

    Jun 22, 2026Youxin Zhu, Yixuan Ding, Peng Lai +3LLM EvaluationAI Agent Benchmarks

  19. ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

    Jun 22, 2026Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang +3Distribution Shift RobustnessComputer-Use Agent Benchmarks

  20. Agent-as-a-Router: Agentic Model Routing for Coding Tasks

    Jun 22, 2026Pengfei Zhou, Zhiwei Tang, Yixing Ma +8AI Coding AgentsAI Agent Benchmarks

  21. MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

    Jun 21, 2026Yikun Fu, Bowen Fu, Zhenyu Wu +10Computer-Use Agent BenchmarksComputer-Use Agents