Agent Benchmarks

Momentum

9 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 87

All topics
CardsList
  1. MMPostTrainBench: Benchmarking Autonomous Research for Multimodal Post-Training

    Oct 4, 2026Yuxin Liu, Yuxuan Wang, Zhenxin Lei +9Multimodal Model EvaluationAgent Benchmarks

  2. GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation

    Oct 4, 2026Murad Hossen, Tasneem Selim, Gurur Gamgam +22LLM EvaluationGraph Neural Networks

  3. DAYJOB: A Benchmark for Long-Horizon Professional Work

    Oct 1, 2026Stephanie Finley, Liudas Panavas, Thomas Mikkelson +12LLM Agent EvaluationLong-Horizon Agent Tasks

  4. EngramBench: A Capability-Grounded Benchmark for Skill-Evolution Harnesses

    Sep 30, 2026Zhixuan Tan, Pengjie Gu, Zhao Li +4Software Engineering BenchmarksLong-Horizon Agent Evaluation

  5. AerialDojo-200K: A Large-Scale Benchmark Suite for Open-World Aerial Object-Goal Search

    Sep 28, 2026Tongtong Feng, Xin Wang, Haoran Hou +9Aerial RoboticsObject-Goal Navigation

  6. GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

    Sep 21, 2026Yiran Wang, Xingyilang Yin, Junfu Pu +12Game-Playing AgentsLong-Horizon Agent Evaluation

  7. Quantifying Overclaiming Propensity in Frontier LLM Agents

    Sep 17, 2026Nolan Smyth, Yorguin-Jose Mantilla-Ramos, Pascal Jr Tikeng Notsawo +6AI Agent ReliabilityAI Coding Agents

  8. Benchmarking Hybrid Deep Research Across Database Querying and Web Search

    Sep 8, 2026Ruofan Wu, Peiran Xu, Xiaolong Li +9Deep Research AgentsAgentic Search

  9. InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations

    Sep 1, 2026Maeve Hutchinson, Syed Mahbubul Huq, Mohammad Albinhassan +3VLM EvaluationClaim Verification

  10. GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

    Aug 31, 2026Boqi Chen, Xudong Liu, Yunke Ao +2HealthcareConstrained RL

  11. You Know What I Mean: A Benchmark for Agentic Conversational Reference Grounding

    Aug 30, 2026Karen Fuchs, Uri Katz, Yoav GoldbergSoftware Engineering AgentsAgentic Retrieval

  12. BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

    Aug 26, 2026Zane Koch, Asmamaw T. Wassie, Javier Valdes-Aleman +5AI for ScienceAI Agent Benchmarks

  13. One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

    Aug 20, 2026Zhuochun Li, Youngmin Ko, Ali Keramati +11Business Process AutomationAI Agent Benchmarks

  14. DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

    Aug 11, 2026Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub +3Computer-Use Agent BenchmarksAI Agent Evaluation

  15. CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

    Aug 7, 2026Veronica Chatrath, Bryan Zhu, George Pu +16Evidence-Grounded ReasoningClinical Reasoning

  16. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

    Aug 6, 2026Fanzhe Meng, Guoxin Chen, Jiale Zhao +6LLM Agent TrainingAgent Benchmarks

  17. Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

    Aug 5, 2026Nathan S Johnson, Ian AbshireAI Agents for Scientific DiscoveryLLM Agent Orchestration

  18. SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

    Aug 3, 2026Zelin Tan, Yiqun Zhang, Hao Li +11LLM Agent Skill LearningLLM Agent Trajectory Synthesis

  19. PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

    Aug 2, 2026Xidong Yang, Xingyi Zhang, Wenhao Li +7Continual Learning for LLM AgentsLifelong Learning Agents

  20. MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing

    Jul 31, 2026Natan Vidra, Alina Kapanova, Arun Kanhai +1Agentic WorkflowsAgent Evaluation

  21. Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

    Jul 30, 2026Haomin Qi, Xingliang Wang, Xuanqi Gao +9Code Generation BenchmarksAgent Benchmarks

  22. DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

    Jul 30, 2026Debin Meng, Jiaming Yang, Zefang Zong +4LLM Agent EvaluationAutomated Evaluation

  23. Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

    Jul 28, 2026Abhishek Pillai, Samir Kumar Nayak, Yuan ChenComputer-Use Agent BenchmarksComputer-Use Agents

  24. WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

    Jul 20, 2026Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3LLM EvaluationForecasting Benchmarks

  25. RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

    Jul 18, 2026Mihir Shriniwas AryaCompositional ReasoningLLM Agent Memory