AI Agent Benchmarks

Momentum

209 papers in the last four weeks, up 61% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,159

All topics
CardsList
  1. Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

    Apr 30, 2026Chenxin Li, Zhengyang Tang, Mingxin Huang +8LLM Agent EvaluationAI Agent Benchmarks

  2. D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

    Apr 30, 2026Hanane Nour Moussa, Yifei Li, Zhuoyang Li +7AI Agents for Scientific DiscoveryAI Agent Benchmarks

  3. WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments

    Apr 30, 2026Jinchao Li, Yunxin Li, Chenrui Zhao +3Computer-Use Agent BenchmarksComputer-Use Agents

  4. RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems

    Apr 30, 2026Jiacheng Liu, Zichen Tang, Zhongjun Yang +8Multi-Agent LLM SystemsLLM Planning

  5. ClawGym: A Scalable Framework for Building Effective Claw Agents

    Apr 29, 2026Fei Bai, Huatong Song, Shuang Sun +11Synthetic Data GenerationAI Agent Benchmarks

  6. StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall

    Apr 29, 2026Yerong Wu, Tianxing Wu, Minghao Zhu +2Conversational MemoryAI Agent Benchmarks

  7. LATTICE: Evaluating Decision Support Utility of Crypto Agents

    Apr 29, 2026Aaron Chan, Tengfei Li, Tianyi Xiao +3AI-Assisted Decision MakingAI Agent Benchmarks

  8. DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

    Apr 28, 2026Jinxiang Meng, Shaoping Huang, Fangyu Lei +17Data VisualizationAI Agent Benchmarks

  9. ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

    Apr 28, 2026Sidi Chang, Peiying Zhu, Yuxiao ChenLLM-as-a-JudgeAI Agent Evaluation

  10. Cooperate to Compete: Strategic Coordination in Multi-Agent Conquest

    Apr 28, 2026Abigail O'Neill, Alan Zhu, Mihran Miroyan +2Multi-Agent CoordinationMulti-Agent Negotiation

  11. Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

    Apr 27, 2026Joshua Sherwood, Ben Aybar, Benjamin KaplanAI Coding AgentsAI Agent Evaluation

  12. BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

    Apr 27, 2026Xinming Tu, Tianze Wang, Yingzhou +4Benchmark AuditingAI Agent Benchmarks

  13. Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

    Apr 27, 2026Zhou Ziheng, Huacong Tang, Jinyuan Zhang +9AI Agents for Scientific DiscoveryCircuit Discovery

  14. NeuroClaw Technical Report

    Apr 27, 2026Cheng Wang, Zhibin He, Zhihao Peng +7Multi-Agent LLM SystemsAI Agent Benchmarks

  15. Skill Retrieval Augmentation for Agentic AI

    Apr 27, 2026Weihang Su, Jianming Long, Qingyao Ai +6AI Agent BenchmarksLLM Agent Skill Retrieval

  16. AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

    Apr 27, 2026Hongxin Li, Xiping Wang, Jingran Su +4VLM EvaluationGUI Agents

  17. OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

    Apr 27, 2026Zheng Wu, Yi Hua, Zhaoyuan Huang +8Computer-Use AgentsAI Agent Evaluation

  18. AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

    Apr 27, 2026Yuxuan Gao, Megan Wang, Yi Ling YuAI Agent EvaluationAI Agent Benchmarks

  19. MarketBench: Evaluating AI Agents as Market Participants

    Apr 26, 2026Andrey Fradkin, Rohit KrishnanMulti-Agent CoordinationLLM Agent Evaluation

  20. SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

    Apr 25, 2026Zi Meng, Wanli Song, Yi Hu +2Multi-Agent LLM SystemsSports Video Analysis

  21. Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

    Apr 24, 2026Mengzhuo Chen, Junjie Wang, Fangwen Mu +4Agent Failure AnalysisMulti-Agent LLM Systems

  22. Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

    Apr 24, 2026Xirui Li, Ming Li, Yunze Xiao +4Multi-Agent CoordinationAI Agent Evaluation

  23. AgentSearchBench: A Benchmark for AI Agent Search in the Wild

    Apr 24, 2026Bin Wu, Arastun Mammadli, Xiaoyu Zhang +1Agentic SearchAI Agent Evaluation

  24. When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

    Apr 23, 2026Chenghao Yang, Yuning Zhang, Zhoufutu Wen +4Tool-Augmented Language Model AgentsLLM Agent Evaluation

  25. How VLAs (Really) Work In Open-World Environments

    Apr 23, 2026Amir Rasouli, Yangzheng Wu, Zhiyuan Li +4VLM RobustnessLong-Horizon Robotic Manipulation