AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

    Jul 9, 2026Yifan Zhou, Qihao Yang, Yan Li +14Scientific ReasoningScientific Hypothesis Generation

  2. Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

    Jul 9, 2026Sophia Koehler, Antonia Wüst, Inga Ibs +5AI Agent EvaluationActive Learning

  3. CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

    Jul 9, 2026Andrej Leban, Yuekai SunStructural Causal ModelsAI Agent Benchmarks

  4. Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

    Jul 8, 2026Ethan Chung, Chuanjun Zheng, Jasper Tan +3VLM EvaluationAI Agent Benchmarks

  5. Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

    Jul 7, 2026Razvan Mihai PopescuSoftware Engineering AgentsLLM Agent Evaluation

  6. LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

    Jul 7, 2026Chenxu Wang, Yongkun Yang, Boyuan Du +2LLM Agent EvaluationMulti-Agent Collaboration

  7. AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

    Jul 7, 2026Andrey Podivilov, Vadim Lomshakov, Sergey Savin +4Computer-Use Agent BenchmarksAI Coding Agents

  8. PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents

    Jul 7, 2026Hongliang Li, Yijin Liu, Zhiwei Zhang +5Multilingual Language Model EvaluationLong-Horizon Agent Evaluation

  9. EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

    Jul 6, 2026Xingze Gao, Chuanrui Hu, Hongda Chen +9LLM Agent Self-ImprovementAI Agent Benchmarks

  10. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

    Jul 6, 2026Zhiheng Xi, Dingwen Yang, Jiaqi Liu +22LLM Agent EvaluationAI Agent Benchmarks

  11. HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

    Jul 5, 2026Yaozu Wu, Wei-Chieh Huang, Jizhou Guo +11LLM Agent EvaluationHuman-in-the-Loop Evaluation

  12. CausalGame: Benchmarking Causal Thinking of LLM Agents in Games

    Jul 5, 2026Zhenhao Chen, Yongqiang Chen, Chenxi Liu +7AI Agents for Scientific DiscoveryAI Agent Benchmarks

  13. Second MOASEI Competition at AAMAS'2026: A Technical Report

    Jul 3, 2026Ceferino Patino, Tyler J. Billings, Alireza Saleh Abadi +4Multi-Agent CoordinationAI Agent Benchmarks

  14. APeB: Benchmarking Personalization Ability of Large Language Model Agents

    Jul 3, 2026Garry Yang, Zizhe Chen, Xinru Chen +9LLM PersonalizationLLM Agent Evaluation

  15. Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

    Jul 3, 2026Dan C. Hsu, Luke LuLLM Agent EvaluationAI Agent Benchmarks

  16. S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

    Jul 2, 2026Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez +7Temporal Video GroundingEpisodic Memory

  17. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

    Jul 2, 2026Zhilin Wang, Han Song, Runzhe Zhan +13RL BenchmarksAI Agent Benchmarks

  18. Understanding Agent-Based Patching of Compiler Missed Optimizations

    Jul 2, 2026Batu Guan, Zirui Wang, Shaohua LiAI Coding AgentsLarge Language Model-Guided Optimization

  19. AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

    Jul 2, 2026Xiangchen Cheng, Yunwei Jiang, Jianwen Sun +7LLM Agent MemoryLong-Horizon Agent Evaluation

  20. PACE: A Proxy for Agentic Capability Evaluation

    Jul 2, 2026Yueqi Song, Lintang Sutawika, Jiarui Liu +8Benchmark DesignLLM Agent Evaluation

  21. AgenticDataBench: A Comprehensive Benchmark for Data Agents

    Jul 2, 2026Zhaoyan Sun, Shan Zhong, Daizhou Wen +10LLM Agent EvaluationAI Agent Benchmarks

  22. World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

    Jul 1, 2026Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan +1LLM Agent EvaluationAI Agent Benchmarks

  23. MemSyco-Bench: Benchmarking Sycophancy in Agent Memory

    Jul 1, 2026Zhishang Xiang, Zerui Chen, Yunbo Tang +5Agent MemoryLLM Sycophancy

  24. LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

    Jul 1, 2026Ruotong Zhao, Zhiyu Chen, Xurui Liu +7Human Preference EvaluationLLM-as-a-Judge