AI Agent Benchmarks

Momentum

146 papers in the last four weeks, up 161% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

    Jun 11, 2026Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces +2LLM Agent EvaluationGeospatial Reasoning

  2. Benchmarking AI Agents for Addressing Scientific Challenges Across Scales

    Jun 10, 2026Tianyu Liu, Allen Xin Wang, Antonia Panescu +30AI for ScienceAI Agent Evaluation

  3. Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks

    Jun 10, 2026Mengyu Zheng, Kai Han, Boxun Li +13AI Coding AgentsSoftware Engineering Benchmarks

  4. MedCTA: A Benchmark for Clinical Tool Agents

    Jun 10, 2026Tajamul Ashraf, Hyewon Jeong, Fida Mohammad Thoker +1Agent EvaluationAI Agent Benchmarks

  5. DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

    Jun 10, 2026Raffi KhatchadourianAgent EvaluationAI Agent Benchmarks

  6. AI Coding Agents Can Reproduce Social Science Findings

    Jun 9, 2026Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi +2AI Coding AgentsAI Agent Benchmarks

  7. Can AI Agents Synthesize Scientific Conclusions?

    Jun 9, 2026Hayoung Jung, Pedro Viana Diniz, José Reinaldo Corrêa Roveda +5AI Agent EvaluationAI Agent Benchmarks

  8. From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

    Jun 9, 2026Yifan Li, Shengbin Yue, Boyu Feng +6LLM Agent EvaluationAI Agent Benchmarks

  9. T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains

    Jun 9, 2026Genta Indra Winata, Amartya Chakraborty, Yuzhen Lin +12Customer Support AutomationLLM Agent Evaluation

  10. Skill Coverage: A Test Adequacy Metric for Agent Skills

    Jun 9, 2026Boyin Tan, Xiaowei Huang, Youcheng SunLLM Agent EvaluationAI Agent Benchmarks

  11. LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake

    Jun 9, 2026Haonan Wang, Jiaxiang Liu, Yurong Liu +11Multi-Hop QAAI Agent Benchmarks

  12. STAGE-Claw: Automated State-based Agent Benchmarking for Realistic Scenarios

    Jun 9, 2026Sirui Liang, Bohan Yu, Peiyu Wang +8Computer-Use Agent BenchmarksLLM Agent Evaluation

  13. ττ-Rec: A Verifiable Benchmark for Agentic Recommender Systems

    Jun 8, 2026Bharath Sivaram Narasimhan, Karthik R NarasimhanAI Agent ReliabilityAI Agent Benchmarks

  14. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

    Jun 8, 2026Mingxian Lin, Shengju Qian, Yuqi Liu +9VLM EvaluationGame-Playing Agents

  15. iOSWorld: A Benchmark for Personally Intelligent Phone Agents

    Jun 8, 2026Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom +3Computer-Use Agent BenchmarksComputer-Use Agents

  16. SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

    Jun 8, 2026Hongcheng Gao, Hailong Qu, Jingyi Tang +18Spatial Reasoning BenchmarksVisual Spatial Reasoning

  17. H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human Interactions

    Jun 8, 2026Shiping Zhu, Yibo Yang, Zhengyang Wang +3Multimodal MemoryLLM Agent Memory

  18. Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

    Jun 8, 2026Ziqian Zhong, Ivgeni Segal, Ivan Bercovich +3Reward HackingAI Agent Security Benchmarks

  19. PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting

    Jun 7, 2026Youran Sun, Xingyu Ren, Kejia Zhang +2Multi-Agent OrchestrationLLM Agent Evaluation

  20. Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

    Jun 6, 2026Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker +7Multi-Agent CoordinationLLM Agent Evaluation

  21. M3^3Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

    Jun 5, 2026Zhengjun Huang, Wenxuan Liu, Zhoujin Tian +6Multimodal GroundingEfficient Multimodal Inference