AI Agent Benchmarks

Momentum

146 papers in the last four weeks, up 161% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models

    Jun 20, 2026Weiyuan Zhou, Haiping Ma, Xiaoshan Yu +3Multi-Agent LLM SystemsEducational Assessment

  2. ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

    Jun 19, 2026Vincent Siu, Manasi Sharma, Dawn Song +2Computer-Use Agent BenchmarksComputer-Use Agents

  3. Trip+: Benchmarking Agents in Personalized Interactive Travel Planning

    Jun 19, 2026Junle Chen, Wei Chen, Yehong Xu +6LLM Agent EvaluationAI Agent Benchmarks

  4. AgentMeter: Evaluating Model-CLI Matching for CLI-Based Local Task-Solving Agents

    Jun 19, 2026Han Chi, Jiaxin Qi, Yan Cui +2LLM Agent EvaluationAI Agent Benchmarks

  5. Agentic Time Machine as an Infrastructure for Future-Event Forecasting

    Jun 19, 2026Jingyi Chai, Bingyang Zheng, Xiangrui Liu +5Multi-Agent LLM SystemsLLM Agent Evaluation

  6. ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

    Jun 18, 2026Jiajun Li, Mingshu Cai, Yixuan Li +5LLM Agent EvaluationAI Agent Benchmarks

  7. Benchmarking Agentic Review Systems

    Jun 18, 2026Dang Nguyen, Wanqing Hao, Yanai Elazar +1LLM Agent EvaluationAI Agent Benchmarks

  8. IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

    Jun 17, 2026Ahmad Salimi, Wentao Ma, Yuzhi Tang +3Audio-Language Model EvaluationAI Agent Benchmarks

  9. Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

    Jun 17, 2026Shengyuan Ding, Xilin Wei, Xinyu Fang +4Multimodal MemorySequential Decision Making

  10. TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

    Jun 17, 2026Hannah Le, Ramesh Ramasamy, Alex Urrutia +3AI Agent EvaluationAI Agent Benchmarks

  11. WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

    Jun 17, 2026Yehang Zhang, Jianchong Su, Haojian Huang +7Embodied QALong-Horizon Agent Evaluation

  12. Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

    Jun 17, 2026Tianming Du, Peijie Yu, Sihan Shang +12AI Agent BenchmarksClinical Language Model Evaluation

  13. CEO-Bench: Can Agents Play the Long Game?

    Jun 16, 2026Haozhe Chen, Karthik Narasimhan, Zhuang LiuLong-Horizon Agent EvaluationAI Agent Benchmarks

  14. ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

    Jun 16, 2026Shanda Li, Qiuhong Anna Wei, Jingwu Tang +5LLM Agent EvaluationAI Agent Benchmarks

  15. GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

    Jun 16, 2026Tongxu Luo, Rongsheng Wang, Jiaxi Bi +22AI Agent BenchmarksAgentic Code Generation

  16. Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

    Jun 16, 2026Maria I. Gorinova, Macey Baker, Amy Heineike +3AI Coding AgentsBenchmark Design

  17. ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

    Jun 16, 2026Hong Yang, Basura FernandoVisual Spatial ReasoningEmbodied QA

  18. SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

    Jun 16, 2026Congjie Zheng, Chuanyi Xue, Bin Liang +2LLM Agent EvaluationAI Agent Benchmarks

  19. Offline Preference-Based Trajectory Evaluation

    Jun 16, 2026Fernando DiazAI Agent EvaluationAI Agent Benchmarks

  20. Dissecting model behavior through agent trajectories

    Jun 16, 2026Gaurav Gupta, Vatshank Chaturvedi, Jun Huan +1Software Engineering AgentsLLM Agent Evaluation

  21. Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

    Jun 16, 2026Li Gu, Zihuan Jiang, Linqiang Guo +6Mobile GUI AutomationAI Coding Agents

  22. MemTrace: Probing What Final Accuracy Misses in Long-Term Memory

    Jun 15, 2026Xianxuan Long, Zhikai Chen, Shenglai Zeng +3Temporal Reasoning in Language ModelsLLM Agent Memory