AI Agent Benchmarks

Momentum

146 papers in the last four weeks, up 161% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

    Jun 5, 2026Kai A. Horstmann, Ethan Lin, Alice A. Robie +2AI Agent EvaluationScientific Code Generation

  2. Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

    Jun 4, 2026Jiaju Chen, Yuxuan Lu, Jiayi Su +10Multi-Agent CollaborationAI Agent Benchmarks

  3. Evaluating Agentic Configuration Repair for Computer Networks

    Jun 4, 2026Rufat Asadli, Benjamin Hoffman, Ioannis Protogeros +1LLM Agent EvaluationAI Agent Benchmarks

  4. MacArena: Benchmarking Computer Use Agents on an Online macOS Environment

    Jun 4, 2026Victor Muryn, Maksym Shamrai, Sofiia Mazepa +1Computer-Use Agent BenchmarksComputer-Use Agents

  5. Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

    Jun 4, 2026Xin Wang, Liangtai Sun, Yaoming Zhu +8Computer-Use Agent BenchmarksLanguage Model Generation Evaluation

  6. When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

    Jun 4, 2026Dongsheng Zhu, Xuchen Ma, Yucheng Shen +5AI Agent ReliabilityAI Agent Benchmarks

  7. CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement

    Jun 4, 2026Hong Qian, Yuanhao Liu, Zihan Zhou +7Game-Playing AgentsHuman Behavior Simulation

  8. SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

    Jun 4, 2026Wenxuan Wang, Haoyu Sun, Fukuan Hou +4Persistent Memory for Language ModelsLong-Horizon Agent Evaluation

  9. Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows

    Jun 4, 2026Yuhang Fu, Ruishan Fang, Jiaqi Shao +4Multi-Agent LLM SystemsLLM Agent Evaluation

  10. AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

    Jun 4, 2026Jiayu Liu, Cheng Qian, Zhenhailong Wang +10LLM PlanningLLM Agent Evaluation

  11. TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

    Jun 4, 2026Bobby Yan, Fredrik KjolstadAI Coding AgentsBenchmark Design

  12. ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?

    Jun 4, 2026Woojung Song, Nalim Kim, Sangjun Song +3Large Language Model-Based Role-Play SimulationPersonality Modeling in Language Models

  13. ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

    Jun 4, 2026Jintao Huang, Xiaomin Li, Gaurav Mittal +1AI Coding AgentsLLM Agent Evaluation

  14. PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

    Jun 3, 2026Keqi Han, Ryan Young, Annabel Strauss +7HealthcareAI Agent Benchmarks

  15. Agents' Last Exam

    Jun 3, 2026Yiyou Sun, Xinyang Han, Weichen Zhang +307Computer-Use Agent BenchmarksLong-Horizon Agent Evaluation

  16. SentinelBench: A Benchmark for Long-Running Monitoring Agents

    Jun 3, 2026Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin +5Computer-Use Agent BenchmarksWeb Agent Benchmarks

  17. Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

    Jun 3, 2026Cheng Liang, Pengcheng Qiu, Ya Zhang +3LLM Agent EvaluationAI Agent Benchmarks

  18. AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

    Jun 3, 2026Zhangchen Xu, Junda Chen, Yue Huang +16Long-Horizon Agent EvaluationAI Agent Benchmarks

  19. Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

    Jun 3, 2026Kaustav Kundu, Ritvik Shrivastava, Maxim Arap +13LLM PlanningEgocentric Video Understanding

  20. Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

    Jun 3, 2026Haoyu Sun, Wenxuan Wang, Mingyang Song +5Tool-Augmented Language Model AgentsLLM Agent Evaluation

  21. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  22. FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

    Jun 3, 2026Leonardo Bertolazzi, Katya Tentori, Raffaella BernardiLLM EvaluationAI Agent Benchmarks

  23. Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms

    Jun 3, 2026Jiashu Yao, Heyan Huang, Daiqing Wu +5GUI AgentsAI Agent Benchmarks

  24. LifeSide: Benchmarking Agents as Lifelong Digital Companions

    Jun 3, 2026Yuqian Wu, Zhijie Deng, Wei Chen +8Long-Horizon Agent EvaluationAI Companions

  25. Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation

    Jun 3, 2026Yongjie Wang, Xinyue Zhang, Kunhong Yao +4Deep Research AgentsLLM Agent Evaluation

  26. The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?

    Jun 3, 2026Xinyu Lu, Tianshu Wang, Pengbo Wang +8AI Agent BenchmarksSelf-Improving Agents

  27. Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline

    Jun 3, 2026Zhikai Chen, Jialiang Gu, Junyu Yin +6Agent MemoryLLM Agent Memory