AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. Interface-Induced Trajectory Censoring

    Sep 3, 2026Wenbo WangTool-Use EvaluationAI Agent Evaluation

  2. KC-Bench: A Dynamic Interactive Benchmark for Evaluating Knowledge Conflicts in LLM Agents

    Sep 3, 2026Yaxing Lyu, Shengjie Zhou, Binbin Toh +2Knowledge Conflicts in Language ModelsLLM Agent Evaluation

  3. CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

    Sep 1, 2026Damien Sileo, Dimitri KachlerTemporal Reasoning in Language ModelsAI Agent Benchmarks

  4. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

    Sep 1, 2026Fanrui Zhang, Ruixue Ding, Qiang Zhang +13AI Agent BenchmarksRubric-Based RL

  5. WorldBench: Culturally Grounded Benchmark for Multilingual Agents

    Sep 1, 2026Leonardo Ranaldi, Sherrie Shen, Jushi Kai +1Cross-Cultural Language Model EvaluationLLM Agent Evaluation

  6. RestoreBench: Can AI Agents Restore Power Flow Convergence?

    Aug 31, 2026Riccardo Mansutti, Andrea Pomarico, Robert Jakob +3Multi-Agent LLM SystemsLLM Agent Evaluation

  7. Toward Workflow-Aware Benchmarking for Healthcare NLP Agents

    Aug 31, 2026Junyi Yao, Baichuan Li, Zihao Zheng +1Benchmark DesignLLM Agent Evaluation

  8. MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

    Aug 31, 2026Vernon Toh, Navonil Majumder, Zhengyuan Liu +2Active PerceptionAI Agent Evaluation

  9. E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

    Aug 31, 2026Wei Fan, Xinjie Shen, Xudong Guo +8Long-Horizon Agent EvaluationAI Agent Benchmarks

  10. BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

    Aug 31, 2026Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs +3Reward HackingAI Agent Evaluation

  11. SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?

    Aug 31, 2026Jinshan Gao, Zhuoran Jin, Tianyi Men +2LLM Agent OrchestrationAI Agent Benchmarks

  12. Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

    Aug 31, 2026Hanlin Tian, Minhao Li, Yu Mi +5LLM Agent EvaluationAI Agent Benchmarks

  13. Science sandboxes measure the scientific capability of AI agents

    Aug 31, 2026Arya S. Rao, Rodrigo I. Castro, Sager J. Gosai +8Protein Fitness PredictionAI Agent Evaluation

  14. Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment

    Aug 30, 2026Zhiyu Chen, Keyu Zhao, Jigao Fu +8AI Agents for Scientific DiscoveryLLM-as-a-Judge

  15. Cost-Effective Repository Exploration for Agentic Issue Localization

    Aug 30, 2026Mohammad Nour Al Awad, Sergey IvanovAI Coding AgentsAgentic Search

  16. BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

    Aug 26, 2026Zane Koch, Asmamaw T. Wassie, Javier Valdes-Aleman +5AI for ScienceAI Agent Benchmarks

  17. LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

    Aug 24, 2026Xiao Zhang, Qumeng Sun, Jiahao Li +3Agent MemoryLLM Evaluation

  18. TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

    Aug 24, 2026Wenhao Wu, Menghao Zhang, Xin Wang +3Tool-Augmented Language Model AgentsLLM Agent Orchestration

  19. K-Bench: measuring model performance on real scientific agent requests

    Aug 21, 2026Aubrey M. Brueckner, Darshil Patel, Yuhuan He +1AI for ScienceLLM Agent Evaluation

  20. One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

    Aug 20, 2026Zhuochun Li, Youngmin Ko, Ali Keramati +11Business Process AutomationAI Agent Benchmarks

  21. QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Aug 13, 2026Shangao Li, Yao Zhang, Volker Tresp +1LLM Agent EvaluationAgent Evaluation

  22. Vero: Can AI Agents Build Formally Verified Software Repositories?

    Aug 13, 2026Zhe Ye, Hantao Lou, Yuechun Sun +8Code GenerationFormal Verification

  23. Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    Aug 13, 2026Yiwei Li, Wanli Yang, Hexiang Tan +10Long-Horizon Agent EvaluationAgent Harness Optimization