AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. Can Coding Agents Reproduce Findings in Computational Materials Science?

    May 1, 2026Ziyang Huang, Yi Cao, Ali K. Shargh +15Coding AgentsAI Agent Benchmarks

  2. AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

    May 1, 2026Ranit Karmakar, Jayita ChatterjeeComputer-Use Agent BenchmarksLLM Agent Evaluation

  3. Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

    Apr 30, 2026Chenxin Li, Zhengyang Tang, Mingxin Huang +8LLM Agent EvaluationAI Agent Benchmarks

  4. D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

    Apr 30, 2026Hanane Nour Moussa, Yifei Li, Zhuoyang Li +7AI Agents for Scientific DiscoveryAI Agent Benchmarks

  5. WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments

    Apr 30, 2026Jinchao Li, Yunxin Li, Chenrui Zhao +3Computer-Use Agent BenchmarksComputer-Use Agents

  6. RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems

    Apr 30, 2026Jiacheng Liu, Zichen Tang, Zhongjun Yang +8Multi-Agent LLM SystemsLLM Planning

  7. ClawGym: A Scalable Framework for Building Effective Claw Agents

    Apr 29, 2026Fei Bai, Huatong Song, Shuang Sun +11Synthetic Data GenerationAI Agent Benchmarks

  8. StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall

    Apr 29, 2026Yerong Wu, Tianxing Wu, Minghao Zhu +2Conversational MemoryAI Agent Benchmarks

  9. LATTICE: Evaluating Decision Support Utility of Crypto Agents

    Apr 29, 2026Aaron Chan, Tengfei Li, Tianyi Xiao +3AI-Assisted Decision MakingAI Agent Benchmarks

  10. DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

    Apr 28, 2026Jinxiang Meng, Shaoping Huang, Fangyu Lei +17Data VisualizationAI Agent Benchmarks

  11. ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

    Apr 28, 2026Sidi Chang, Peiying Zhu, Yuxiao ChenLLM-as-a-JudgeAI Agent Evaluation

  12. Cooperate to Compete: Strategic Coordination in Multi-Agent Conquest

    Apr 28, 2026Abigail O'Neill, Alan Zhu, Mihran Miroyan +2Multi-Agent CoordinationMulti-Agent Negotiation

  13. Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

    Apr 27, 2026Joshua Sherwood, Ben Aybar, Benjamin KaplanAI Coding AgentsAI Agent Evaluation

  14. BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

    Apr 27, 2026Xinming Tu, Tianze Wang, Yingzhou +4Benchmark AuditingAI Agent Benchmarks

  15. Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

    Apr 27, 2026Zhou Ziheng, Huacong Tang, Jinyuan Zhang +9AI Agents for Scientific DiscoveryCircuit Discovery

  16. NeuroClaw Technical Report

    Apr 27, 2026Cheng Wang, Zhibin He, Zhihao Peng +7Multi-Agent LLM SystemsAI Agent Benchmarks

  17. Skill Retrieval Augmentation for Agentic AI

    Apr 27, 2026Weihang Su, Jianming Long, Qingyao Ai +6AI Agent BenchmarksLLM Agent Skill Retrieval

  18. AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

    Apr 27, 2026Hongxin Li, Xiping Wang, Jingran Su +4VLM EvaluationGUI Agents

  19. OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

    Apr 27, 2026Zheng Wu, Yi Hua, Zhaoyuan Huang +8Computer-Use AgentsAI Agent Evaluation

  20. AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

    Apr 27, 2026Yuxuan Gao, Megan Wang, Yi Ling YuAI Agent EvaluationAI Agent Benchmarks

  21. MarketBench: Evaluating AI Agents as Market Participants

    Apr 26, 2026Andrey Fradkin, Rohit KrishnanMulti-Agent CoordinationLLM Agent Evaluation

  22. SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

    Apr 25, 2026Zi Meng, Wanli Song, Yi Hu +2Multi-Agent LLM SystemsSports Video Analysis

  23. Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

    Apr 24, 2026Mengzhuo Chen, Junjie Wang, Fangwen Mu +4Agent Failure AnalysisMulti-Agent LLM Systems

  24. Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

    Apr 24, 2026Xirui Li, Ming Li, Yunze Xiao +4Multi-Agent CoordinationAI Agent Evaluation

  25. AgentSearchBench: A Benchmark for AI Agent Search in the Wild

    Apr 24, 2026Bin Wu, Arastun Mammadli, Xiaoyu Zhang +1Agentic SearchAI Agent Evaluation