Agent Benchmarks

Momentum

9 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 87

All topics
CardsList
  1. LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

    Jul 10, 2026Zihan Xu, Yanzhen Chen, Xiaocheng Zhang +4Long-Horizon Agent EvaluationClinical Decision-Making

  2. FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

    Jul 7, 2026Chase McDonald, Nathan Tsang, Wesley N. KerrRL BenchmarksGame-Playing Agents

  3. PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

    Jun 30, 2026Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar +6Computer-Use AgentsRubric-Based Evaluation

  4. SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows

    Jun 29, 2026Jian Zhu, Yuzheng Zhang, Zeyao Ma +11Benchmark DesignSpreadsheet Automation

  5. AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning

    Jun 23, 2026Honglin Guo, Qi Zhang, Yu Zhang +7LLM GroundingDocument QA

  6. ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

    Jun 19, 2026Vincent Siu, Manasi Sharma, Dawn Song +2Computer-Use Agent BenchmarksComputer-Use Agents

  7. ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments

    Jun 18, 2026Tingyue Pan, Mingyue Cheng, Daoyu Wang +4Agentic SearchInformation Retrieval

  8. MortarBench: Evaluating Mortgage Loan Origination Agents

    Jun 17, 2026Matthew Toles, Yunan Lu, Manav Munjal +6Financial ServicesLanguage Model Calibration

  9. CEO-Bench: Can Agents Play the Long Game?

    Jun 16, 2026Haozhe Chen, Karthik Narasimhan, Zhuang LiuLong-Horizon Agent EvaluationAI Agent Benchmarks

  10. DRFLOW: A Deep Research Benchmark for Personalized Workflow Prediction

    Jun 16, 2026Md Tawkat Islam Khondaker, Raymond Li, Muhammad Abdul-Mageed +2LLM PersonalizationDeep Research Agents

  11. A Framework for Evaluating Agentic Skills at Scale

    Jun 16, 2026Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich +3LLM Agent EvaluationInstruction Following

  12. GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

    Jun 15, 2026Maram Hasan, Aman Verma, Savitra Roy +5Disaster Damage AssessmentRL for Language Model Reasoning

  13. Agent Skill Evaluation and Evolution: Frameworks and Benchmarks

    Jun 9, 2026Kexin Ding, Yang Zhou, Can Jin +3Agent Skill LearningAgent Benchmarks

  14. DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

    Jun 4, 2026Nathan Bout, Maxime Langevin, Ronan RiochetGUI AgentsGUI Grounding

  15. Can Generalist Agents Automate Data Curation?

    Jun 2, 2026Feiyang Kang, Hanze Li, Adam Nguyen +5AI Coding AgentsTraining Data Curation

  16. RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

    Jun 2, 2026Zongwei Lv, Zhewen Tan, Yaoming Li +7Computer-Use Agent BenchmarksAI Coding Agents

  17. BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

    Jun 2, 2026Alex Wang, Georg Meinhardt, Jacob Katz +4Benchmark DesignFinancial QA

  18. LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

    May 28, 2026Kewei Xu, Xiaoben Lu, Shuofei Qiao +4Long-Horizon Agent EvaluationLong-Horizon Agent Tasks

  19. Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories

    May 28, 2026Minyang Hu, Bo Yang, Zhinuo Zhou +4LLM Agent EvaluationAgent Trajectory Analysis

  20. PhoneWorld: From Real-App Trajectories to Dynamic and Verifiable Environments for Phone-Use Agents

    May 28, 2026Yuxuan Liu, Xin Lai, Junyi Li +21Mobile GUI AutomationSynthetic Benchmark Generation

  21. Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

    May 27, 2026Linxin Song, Jiefeng Chen, Yue Huang +5Code Generation EvaluationCode Generation Benchmarks

  22. A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

    May 27, 2026Tomer Keren, Nitay Calderon, Asaf Yehudai +3Computer-Use Agent BenchmarksTool-Use Evaluation

  23. CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

    May 27, 2026Yanhui Sun, Wu Liu, Haifeng Ming +3Multimodal ReasoningLLM Decision-Making