AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. ARAC: Benchmarking Auto-Research's Alignment and Completeness on End-to-End Researchs

    Aug 13, 2026Jiale Cui, Yueyao Yuan, Kaixi Zhong +3Human Preference EvaluationAI Agent Benchmarks

  2. DiG-bench: Discovery in Games

    Aug 12, 2026Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan +13Benchmark DesignAI Agent Evaluation

  3. Do LLMs Beat Nash? Testing Decentralized Coordination in Self-Play Multi-Agent Games

    Aug 12, 2026Deborah Sinishaw, Qile Zhu, Edwin Meriaux +1Multi-Agent CoordinationGame Theory

  4. VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

    Aug 12, 2026Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder +6Tool-Use EvaluationAI Agent Benchmarks

  5. CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations

    Aug 12, 2026Xingyu Yan, Tingting Dai, Antonio De Domenico +16AI Agent Benchmarks

  6. Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

    Aug 12, 2026Zining Huang, Haoran Que, Hong Zeng +8AI Coding AgentsLLM Agent Evaluation

  7. MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

    Aug 12, 2026Hojun Choi, Jaeyo Shin, Suin Lee +1AI Agent BenchmarksComputational Creativity

  8. DuplexWorld: Can voice agents help you get through the day?

    Aug 11, 2026Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli +3Voice Agent EvaluationSpoken Dialogue Systems

  9. SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

    Aug 11, 2026Junjie Ye, Zhuohui Sheng, Shaofan Liu +12LLM EvaluationAI Agent Benchmarks

  10. DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

    Aug 11, 2026Xiaotong Wang, Dazhen DengData VisualizationLLM-as-a-Judge

  11. Evaluating Rational Contracting in Natural Language

    Aug 11, 2026Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann +1Multi-Agent NegotiationAutomated Negotiation

  12. TRACE: TRajectory Attribution for Automated Context Engineering

    Aug 10, 2026Yikai Zhao, Pradeep Kumar Misra, Saurabh PandeyAgent Failure AnalysisAI Agent Benchmarks

  13. Evo-Bench: Can Language Models Improve Agent Harness?

    Aug 10, 2026Lisheng Huang, Chen Yang, Hao Zhou +6AI Agent EvaluationLong-Horizon Agent Evaluation

  14. 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

    Aug 9, 2026Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa +2Spatial Reasoning BenchmarksEmbodied Navigation

  15. OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents

    Aug 9, 2026Andrea Caciolai, Pere-Lluís Huguet Cabot, Chierh Cheng +11AI Agent EvaluationAI Agent Benchmarks

  16. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

    Aug 9, 2026Dongjie Xu, Julius, Hanchi Dong +6LLM EvaluationTool-Use Evaluation

  17. SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests

    Aug 9, 2026Donghong Jiang, Endian Lin, Luoping Cui +6AI Agent BenchmarksLLM Agent Skill Retrieval

  18. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

    Aug 9, 2026Yijun Pan, Yukun Lian, Kunyu Shi +5LLM Agent EvaluationAI Agent Benchmarks

  19. ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration

    Aug 9, 2026Guo Chen, Ziwen Li, Reed Li +4Multi-Agent LLM SystemsAI Agent Evaluation

  20. Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

    Aug 8, 2026Yingpeng Ma, Jianhao Yan, Bei Shi +6Interactive StorytellingAI Agent Benchmarks

  21. Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities

    Aug 8, 2026Xiaohe Li, Yiru Wang, Junhao Fan +6Multi-Agent CoordinationRobotics Simulation

  22. TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?

    Aug 8, 2026Yuxuan Zhu, Peng PuSelective PredictionFault Detection

  23. Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

    Aug 7, 2026Jiacheng Miao, Jin Mu, Guanhua Chen +1AI Agent BenchmarksLLM Agent Training