AI Agent Benchmarks

Momentum

146 papers in the last four weeks, up 161% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

    Jun 2, 2026Joel Sol, Homayoun NajjaranMulti-Agent CoordinationLLM Agent Evaluation

  2. Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning

    Jun 2, 2026Eric Cho, Shawn Huang, Alice Lu +1Quantitative FinanceAI Agent Evaluation

  3. The Impact of Configuring Agentic AI Coding Tools on Build-vs-Buy Decisions: A Study Protocol

    Jun 2, 2026Jai Lal Lulla, Matthias Galster, Jie M. Zhang +2Software EngineeringAI Coding Agents

  4. RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

    Jun 2, 2026Zongwei Lv, Zhewen Tan, Yaoming Li +7Computer-Use Agent BenchmarksAI Coding Agents

  5. Multi2^2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

    Jun 2, 2026Sangeun Park, Minhae KwonMulti-Agent LLM SystemsHierarchical RL

  6. SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems

    Jun 2, 2026Linyue Pan, Yaoming Zhu, Lin Qiu +2Multi-Agent CollaborationAI Agent Benchmarks

  7. What Makes Interaction Trajectories Effective for Training Terminal Agents?

    Jun 2, 2026Sidi Yang, Chaofan Tao, Jierun Chen +11AI Agent BenchmarksLLM Agent Training

  8. MeDxAgent: Multi-Agent Consultation for Interactive Medical Diagnosis

    Jun 2, 2026Akshat Sanghvi, Naren Akash, Raza Imam +2Multi-Agent LLM SystemsMedical Diagnosis

  9. MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents

    Jun 2, 2026Jia Yu, Zilong Wang, Xinyang Jiang +2Computer-Use Agent BenchmarksComputer-Use Agents

  10. Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation

    Jun 2, 2026Xunyi Zhao, Sihao Lin, Gengze Zhou +5Embodied NavigationAI Agent Benchmarks

  11. DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

    Jun 2, 2026Wenkai Wang, Tao Xiong, Jingchen Ni +6Computer-Use Agent BenchmarksGUI Agents

  12. What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents

    Jun 1, 2026Victor Ojewale, Suresh VenkatasubramanianAgent EvaluationAI Agent Safety

  13. ΨΨ-Bench: Evaluating Persona-Sensitive Influencing in Persuasive Dialogues

    Jun 1, 2026Peixuan Han, Hongyi Du, Jiayu Liu +3LLM PersonalizationLLM Agent Evaluation

  14. ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents

    Jun 1, 2026Yuxing Lu, Yushuhong Lin, Wenqi Shi +4Long-Horizon Agent EvaluationClinical Decision-Making

  15. HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

    Jun 1, 2026Anshun Asher Zheng, Kanishka Misra, David I. Beaver +1LLM Agent EvaluationAI Agent Benchmarks

  16. MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

    Jun 1, 2026Wenhao Wang, Peizhi Niu, Gongyi Zou +9LLM Agent EvaluationAI Agent Benchmarks

  17. HLL: Can Agents Cross Humanity's Last Line of Verification?

    Jun 1, 2026Xinhao Song, Su Su, Sirui Song +6GUI AgentsAI Agent Evaluation

  18. K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

    Jun 1, 2026Nahyun Lee, Dongkeun Yoon, Guijin Son +12Computer-Use Agent BenchmarksLLM Evaluation

  19. SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

    Jun 1, 2026Yuyan Bu, Haowei Li, Qirui Zheng +7LLM Agent EvaluationAI Agent Safety

  20. TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

    Jun 1, 2026Xinkai Ma, Zhiqi Bai, Dingling Zhang +21Deep Research AgentsAI Agent Benchmarks

  21. Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents

    Jun 1, 2026Kan ShaoAI Agent Benchmarks

  22. Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

    Jun 1, 2026Jiaming Wang, Ziteng Feng, Jiangtao Wu +8Agent Failure AnalysisDeep Research Agents

  23. MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

    Jun 1, 2026Xinyu Che, Junqi Xiong, Yunfei Ge +10Continual Learning for LLM AgentsLLM Agent Skill Learning

  24. AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

    Jun 1, 2026Junqi Liu, Selena Song, Yuhan Wang +12AI Agent EvaluationAI Agent Benchmarks

  25. SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes

    Jun 1, 2026Kuan Li, Shuo Zhang, Huacan Wang +12LLM Agent EvaluationInternet of Things

  26. RescueBench: Can Embodied Agents Save Lives in the Wild ?

    Jun 1, 2026Kui Wu, Beiyu Guo, Hao Chen +6Agent MemoryEmbodied Navigation

  27. Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

    Jun 1, 2026Donghwan Kim, Prakhar Singh, Younghoon Min +3LLM Agent EvaluationAI Agent Benchmarks

  28. RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

    Jun 1, 2026Huayi Lai, Shichao Song, Simin Niu +5Moral Reasoning in Language ModelsAI Agent Benchmarks