AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

    Feb 22, 2026Qijie You, Wenkai Yu, Wentao ZhangMulti-Hop QALLM Agent Evaluation

  2. Evaluating Test-Time Scaling of General LLM Agents

    Feb 22, 2026Xiaochuan Li, Ryan Ming, Pranav Setlur +6LLM Agent EvaluationTest-Time Scaling

  3. ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

    Feb 11, 2026Bang Nguyen, Dominik Soós, Qian Ma +8LLM Agent EvaluationAI Agent Benchmarks

  4. GameDevBench: Evaluating Agentic Capabilities Through Game Development

    Feb 11, 2026Wayne Chi, Yixiong Fang, Arnav Yayavaram +8Software Engineering AgentsAgent Evaluation

  5. Evaluating Memory Structure in LLM Agents

    Feb 11, 2026Alina Shutova, Alexandra Olenina, Ivan Vinogradov +1LLM Agent MemoryLLM Agent Evaluation

  6. ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

    Feb 3, 2026Xiaomeng Zhu, Fengming Zhu, Weijie Zhou +8AI Agent BenchmarksProactive Assistance

  7. Declarative by Design, Assistable Only by Convention: Benchmarking Multi-Agent Frameworks for AI-Assistability

    Feb 3, 2026Shafiuddin Rehan Ahmed, Sourabh DeshpandeAI Agent BenchmarksCode Generation Evaluation

  8. AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

    Feb 2, 2026Shraddha Barke, Arnav Goyal, Alind Khare +3Agent Failure AnalysisAI Agent Reliability

  9. Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

    Jan 30, 2026Yuhao Zhan, Tianyu Fan, Linxuan Huang +2Deep Research AgentsHallucination Detection

  10. EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

    Jan 23, 2026Xinze Li, Ziyue Zhu, Siyuan Liu +4Episodic MemoryLong-Horizon Agent Evaluation

  11. Toward Efficient Agents: Memory, Tool learning, and Planning

    Jan 20, 2026Xiaofang Yang, Lijun Li, Heng Zhou +12LLM Agent MemoryAI Agent Benchmarks

  12. LifeAgentBench: Benchmarking LLMs for Long-Horizon, Cross-Dimensional Lifestyle Health Reasoning

    Jan 20, 2026Ye Tian, Zihao Wang, Onat Gungor +2HealthcareLong-Horizon Agent Evaluation

  13. DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

    Jan 20, 2026Maojun Sun, Yifei Xie, Yue Wu +5LLM Agent EvaluationAgent Evaluation

  14. AstroAgentBench: Evaluating Agentic Planning on Space Mission Planning Tasks

    Jan 16, 2026Weiyi Wang, Xinchi Chen, Jingjing Gong +2LLM Agent EvaluationAI Agent Benchmarks

  15. IDRBench: Benchmarking the Interactive Capabilities of Deep Research Agents

    Jan 10, 2026Yingchaojie Feng, Qiang Huang, Xiaoya Xie +4Deep Research AgentsLLM Agent Evaluation

  16. DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation

    Dec 19, 2025Janghoon Han, Heegyu Kim, Changho Lee +6Deep Research AgentsLLM Agent Evaluation

  17. PPTArena: A Benchmark for PowerPoint Editing

    Dec 2, 2025Michael Ofengenden, Yunze Man, Ziqi Pang +2LLM Agent EvaluationAI Agent Benchmarks

  18. CLIMATEAGENT: Multi-Agent Orchestration for Complex Climate Data Science Workflows

    Nov 25, 2025Chenyue Li, Hyeonjae Kim, Wen Deng +4AI for ScienceMulti-Agent Orchestration

  19. Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

    Nov 24, 2025Dayong Liu, Chao Xu, Weihong Chen +5AI Agent EvaluationMultimodal Large Language Models

  20. IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation

    Nov 21, 2025Yifan Li, Lichi Li, Anh Dao +15Visual Spatial ReasoningEmbodied Navigation

  21. SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

    Nov 20, 2025Juntao Cheng, Wanyue Zhang, Zhiwei Yu +7Long-Horizon Agent EvaluationEgocentric Video Understanding

  22. CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

    Nov 4, 2025Jiayu Liu, Cheng Qian, Zhaochen Su +4LLM PlanningLLM Agent Evaluation

  23. When Users Are Happy but Agents Are Wrong: Multi-Dimensional Evaluation of Tool-Augmented Dialogue

    Oct 22, 2025Tanya Shourya, Yingfan Wang, Zhaoyi Joey Hou +3Tool-Use EvaluationAI Agent Benchmarks

  24. Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search

    Oct 21, 2025Howard Yen, Yoonsang Lee, Ashwin Paranjape +5Agentic SearchLong-Horizon Agent Evaluation

  25. HugAgent: A Human Simulation Benchmark for Individual-Level Reasoning

    Oct 16, 2025Chance Jiajie Li, Zhenze Mo, Yuhan Tang +11Cognitive ModelingHuman Behavior Simulation

  26. Compositional Machine Design as Program Synthesis with LLMs

    Oct 16, 2025Wenqian Zhang, Yangyi Huang, Weiyang Liu +1LLM-Based Program SynthesisProgram Synthesis