AI Agent Benchmarks

Momentum

209 papers in the last four weeks, up 61% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,159

All topics
CardsList
  1. Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints

    Apr 17, 2026Xinge Liu, Terry Jingchen Zhang, Bernhard Schölkopf +2AI Agents for Scientific DiscoveryAI Agent Benchmarks

  2. PolicyBank: Evolving Policy Understanding for LLM Agents

    Apr 16, 2026Jihye Choi, Jinsung Yoon, Long T. Le +2AI Agent BenchmarksAI Agent Governance

  3. CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

    Apr 16, 2026Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita +2Social DilemmasCooperative Game Theory

  4. PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

    Apr 16, 2026Tingjia Miao, Wenkai Jin, Muhua Zhang +19LLM EvaluationAI Agent Benchmarks

  5. HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

    Apr 16, 2026Fan Cui, Hongyuan Hou, Zizhang Luo +2Automated Program RepairElectronic Design Automation

  6. DR3^{3}-Eval: Towards Realistic and Reproducible Deep Research Evaluation

    Apr 16, 2026Qianqian Xie, Qingheng Xiong, He Zhu +16LLM Agent EvaluationLong-Horizon Agent Evaluation

  7. Mind DeepResearch Technical Report

    Apr 16, 2026MindDR Team, Li Auto IncMulti-Agent LLM SystemsDeep Research Agents

  8. HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

    Apr 15, 2026Jiacheng Wang, Jinchang Hou, Fabian Wang +3AI Agent AuditingLong-Horizon Agent Evaluation

  9. UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

    Apr 13, 2026Yijuan Liang, Xinghao Chen, Yifan Ge +5LLM Agent EvaluationAI Agent Benchmarks

  10. Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

    Apr 6, 2026Alhasan Mahmood, Samir Abdaljalil, Hasan KurbanMultilingual Language Model EvaluationLLM-as-a-Judge

  11. Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

    Apr 1, 2026Alibek Kaliyev, Artem MaryanskyyAI Agent ReliabilityTool-Use Evaluation

  12. SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

    Mar 31, 2026Kuangshi Ai, Haichao Miao, Kaiyuan Tang +13Scientific VisualizationData Visualization

  13. LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

    Mar 20, 2026Xiang Long, Li Du, Yilong Xu +11Computer-Use Agent BenchmarksTool-Augmented Language Model Agents

  14. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Mar 19, 2026Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2Multimodal Large Language ModelsAI Agent Benchmarks

  15. ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

    Mar 19, 2026Wanjia Zhao, Ludwig Schmidt, Yejin Choi +3LLM EvaluationAI Agent Benchmarks

  16. CCTU: A Benchmark for Tool Use under Complex Constraints

    Mar 16, 2026Junjie Ye, Guoqiang Zhang, Wenjie Fu +4Tool-Use EvaluationAI Agent Benchmarks

  17. $OneMillion-Bench: How Far are Language Agents from Human Experts?

    Mar 9, 2026Yang Liu, Jiaqi Li, Jun Bai +20LLM Agent EvaluationAI Agent Benchmarks

  18. HVR-Met: A Hypothesis-Verification-Replanning Agentic System for Extreme Weather Diagnosis

    Mar 1, 2026Shuo Tang, Jiadong Zhang, Gengxian Zhou +11Multi-Agent LLM SystemsAI Agent Benchmarks

  19. OmniGAIA: Towards Native Omni-Modal AI Agents

    Feb 26, 2026Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10Multimodal ReasoningAI Agent Benchmarks

  20. Agentic AI for Scalable and Robust Optical Systems Control

    Feb 23, 2026Zehao Wang, Mingzhe Han, Wei Cheng +12LLM Agent OrchestrationAI Agent Benchmarks

  21. AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

    Feb 22, 2026Qijie You, Wenkai Yu, Wentao ZhangMulti-Hop QALLM Agent Evaluation

  22. Evaluating Test-Time Scaling of General LLM Agents

    Feb 22, 2026Xiaochuan Li, Ryan Ming, Pranav Setlur +6LLM Agent EvaluationTest-Time Scaling