AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

    Aug 3, 2026Jiarui Tan, Zhongjian Zhang, YaBo Guo +5LLM Agent EvaluationAI Agent Benchmarks

  2. GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

    Aug 3, 2026Abhinav Pothuri, Zhe Jiang, Zelin Xu +1LLM Agent EvaluationAI Agent Benchmarks

  3. EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

    Aug 2, 2026Phat Tieu, Sayanti Jana, Matthew DeLorenzo +5Retrieval-Augmented GenerationElectronic Design Automation

  4. Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

    Aug 2, 2026Bingxuan Li, Rui Yang, Cheng Qian +6Long-Horizon Agent EvaluationAI Agent Benchmarks

  5. HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +3Multi-Hop QAAI Agent Benchmarks

  6. ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

    Aug 2, 2026Jie Gong, Maowei Jiang, Zhiwei Liu +14Financial ServicesLong-Horizon Agent Evaluation

  7. Control Under Compression: Reliability Frontiers for Tool-Using Agents

    Aug 2, 2026Yinghan Hou, Zongyou YangAI Agent ReliabilityAI Agent Benchmarks

  8. Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

    Aug 2, 2026Tezan Sahu, Aritra Das, Pankaj Mittal +1Benchmark ConstructionLLM Agent Evaluation

  9. AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents

    Aug 1, 2026Alina Kapanova, Arun Kanhai, Natan Vidra +1AI Agent BenchmarksSynthetic Benchmark Generation

  10. AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

    Jul 31, 2026Dong Yan, Jian Liang, Dapeng Hu +4LLM Agent EvaluationAI Agent Benchmarks

  11. AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

    Jul 31, 2026Tianyu Huai, Tingshuo Fan, Xinchi Chen +5LLM Agent EvaluationAI Agent Benchmarks

  12. MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

    Jul 31, 2026Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro +6Coding AgentsScientific Code Generation

  13. MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

    Jul 31, 2026Jianxin Gao, Beini Hu, Runze Li +6Game-Playing AgentsLLM Agent Evaluation

  14. Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark

    Jul 31, 2026Natan Vidra, Alina Kapanova, Arun Kanhai +1Agentic WorkflowsLLM Agent Workflow Optimization

  15. InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

    Jul 31, 2026Yuan Gao, Zeren Yang, Junnan Li +6AI Agent ReliabilityAI Agent Evaluation

  16. MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

    Jul 31, 2026Qiming Shi, Yulong Tao, Linbo Jin +10LLM Agent EvaluationLong-Horizon Agent Evaluation

  17. ORCA-bench: How Ready Are Language Model Agents for Oncall?

    Jul 30, 2026Albert Gong, Kyuseong Choi, Abhineet Agarwal +5Software Engineering AgentsAI Agent Benchmarks

  18. Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

    Jul 30, 2026Jens Lehmann, Andrei Aioanei, Sahar VahdatiGame-Playing AgentsAI Coding Agents

  19. Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

    Jul 30, 2026Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa +3Multi-Agent LLM SystemsSocial Deduction Games