AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

    Jul 29, 2026Jeff Mohl, Nelson Gardner-Challis, Magda Dubois +6Benchmark AuditingAI Agent Benchmarks

  2. Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

    Jul 29, 2026Jinwei Hu, Yi Qi, Xinmiao Huang +3LLM Agent EvaluationAI Agent Benchmarks

  3. VAmoS Bench: Voice Agent Simulation Bench

    Jul 29, 2026Joshua Meyer, Sahar Shayegan, Ritiz Tambi +5Voice Agent EvaluationCustomer Support Automation

  4. APEX-Accounting

    Jul 29, 2026Julien Benchek, Austin Bennett, Jasmin Kern +8LLM EvaluationBusiness Process Automation

  5. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  6. SciDataSailor: Deep Scientific Data Exploring

    Jul 29, 2026Jiyong Rao, Yicheng Qiu, Chi Zhang +2Scientific QAAI Agent Benchmarks

  7. Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

    Jul 28, 2026Stefan Krsteski, Charlotte Meyer, Guillaume Allegre +2AI Agent EvaluationAgent Evaluation

  8. RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

    Jul 28, 2026Fanqing Meng, Lingxiao Du, Qiguang Chen +4LLM Agent EvaluationLLM Agent Self-Improvement

  9. WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

    Jul 28, 2026Hao Liang, Meiyi Qiang, Sizhe Qiu +2Computer-Use Agent BenchmarksAI Agent Benchmarks

  10. OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation

    Jul 28, 2026Zhenzhen Ren, Jiyan He, Xinpeng Zhang +5Multi-Agent CoordinationMulti-Agent Orchestration

  11. PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

    Jul 28, 2026Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou +11AI Agent EvaluationAI Agent Safety

  12. Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

    Jul 27, 2026Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun +2AI Agent BenchmarksLaboratory Automation

  13. GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

    Jul 27, 2026Jiacheng Lu, Sinuo Wang, Wentao Zhao +12Quantitative FinanceFinancial Forecasting

  14. Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

    Jul 27, 2026Bowen Qin, Yi XieSoftware Engineering AgentsAI Agent Benchmarks

  15. Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

    Jul 27, 2026Jingkun Luo, Da-Tian PengData ProvenanceBenchmark Auditing

  16. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

    Jul 26, 2026Weihuang Zheng, Tianyuan Zou, Eileen Ye +5Computer-Use Agent BenchmarksTool-Use Evaluation

  17. Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis

    Jul 26, 2026Xinhao Yao, Yuanzhuo Liu, Changhao Wang +6Deep Research AgentsLLM Agent Evaluation

  18. AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

    Jul 25, 2026Hao Jiang, Gangtao Xin, Yingdi Huang +35Tool-Augmented Language Model AgentsAgentic RL