AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. SceneActBench: Can Agents Act on the 3D Scenes They See?

    Jul 24, 2026Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11AI Agent BenchmarksTool-Using Vision-Language Agents

  2. Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

    Jul 24, 2026Jiaqi Shao, Hanck Chen, Wei Zhang +2Computer-Use Agent BenchmarksReward Hacking

  3. DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

    Jul 24, 2026Junming Chen, Junyang Jiang, Xu Chen +2Benchmark DesignAI Agent Benchmarks

  4. Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

    Jul 24, 2026Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt +5Zero-Shot LearningMultimodal Large Language Models

  5. Agentic Evaluation of Copyright Law Compliance

    Jul 23, 2026Zheng Hui, Doni Bloomfield, Noam KoltAI Agent EvaluationAI Agent Benchmarks

  6. Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

    Jul 23, 2026Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda +1LLM AuditingDeception in Language Models

  7. Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks

    Jul 23, 2026Mack Nixon, Liam Wright, Yevgeniya Kovalchuk +4AI Agent BenchmarksOpen-Weight Language Models

  8. AI Assistants Overassist

    Jul 23, 2026Verona Teo, Raghav Jain, Tobias Gerstenberg +1Intelligent Tutoring SystemsLLM Agent Evaluation

  9. ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

    Jul 23, 2026Zhongyuan Peng, Dan Huang, Chuyu Zhang +8Coding AgentsSoftware Engineering Benchmarks

  10. SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration

    Jul 23, 2026Yinhao Tang, Youqing Fang, Yanan Sun +6AI Agent BenchmarksInformation Retrieval

  11. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Jul 23, 2026Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35Benchmark ContaminationSoftware Engineering Benchmarks

  12. ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

    Jul 22, 2026Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko +1LLM Agent EvaluationAI Agent Benchmarks

  13. LLMs Get Lost in Evolving User Intent

    Jul 22, 2026Jihoon Tack, Philippe Laban, Jennifer NevilleLLM Agent EvaluationAI Agent Benchmarks

  14. KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?

    Jul 22, 2026Peiyu Zang, Jian Tao, Jialing Zhang +4GPU Kernel OptimizationBenchmark Design

  15. Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

    Jul 22, 2026Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker +2Game-Playing AgentsLLM Agent Evaluation

  16. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    Jul 22, 2026Jiazhen Jiang, Boxi Cao, Lingyong Yan +6Long-Horizon Agent EvaluationAI Agent Benchmarks

  17. Same Game, Different Story: A Minimal Conservative Strategic Robustness Benchmark for Large Language Model Agents

    Jul 22, 2026Seyed Pouyan Mousavi Davoudi, Arshia Gharagozlou, Alireza Amiri-Margavi +2AI Agent BenchmarksFraming Effects in Language Models

  18. BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

    Jul 21, 2026Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang +9AI Agent EvaluationAI Agent Benchmarks

  19. AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

    Jul 20, 2026Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva +2World Model LearningAI Agent Benchmarks

  20. Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

    Jul 20, 2026Pin Qian, Su Wang, Yihang Chen +5LLM Agent EvaluationAI Agent Benchmarks

  21. Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

    Jul 20, 2026Jinyuan Deng, Zhengrui Chen, Xufeng Wei +4Electronic Design AutomationLLM Agent Evaluation

  22. EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

    Jul 19, 2026Yaohan Yang, Minglei Shi, Borui Zhang +2Computer-Use Agent BenchmarksGUI Agents

  23. Lomekwi: Resource-Bounded Tool Discovery in LLM Agents

    Jul 18, 2026Roshan Klein-Seetharaman, Daniel Wang, Andrew XuLanguage Model Scaling LawsLLM Agent Evaluation

  24. Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration

    Jul 18, 2026Maksim Sheverev, David Finkelstein, Sergey NikolenkoLLM Agent MemoryAI Agent Benchmarks