AI Agent Benchmarks

Momentum

148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

    May 18, 2026Zhensheng Wang, Wenmian Yang, Qingtai Wu +3Quantitative FinanceBenchmark Design

  2. Evaluating Cognitive Age Alignment in Interactive AI Agents

    May 18, 2026Yifan Shen, Jiawen Zhang, Jian Xu +4LLM Agent EvaluationAI Agent Benchmarks

  3. Interactive Evaluation Requires a Design Science

    May 18, 2026Keyang Xuan, Peiyang Song, Pan Lu +10LLM Agent EvaluationAI Agent Evaluation

  4. FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics

    May 17, 2026Qiran Zou, Hou Hei Lam, Wenhao Zhao +11AI Agents for Scientific DiscoveryInference-Time Search

  5. ContractBench: Can LLM Agents Preserve Observation Contracts?

    May 17, 2026Jicheng Wang, Yifeng He, Zili Wang +3AI Agent ReliabilityLLM Agent Evaluation

  6. 1GC-7RC: One Graphic Card -- Seven Research Challenges! How Good Are AI Agents at Doing Your Job?

    May 16, 2026Robin-Nico Kampa, Fabian Deuser, Anna Bößendörfer +2AI Coding AgentsAI Agent Evaluation

  7. PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

    May 16, 2026Wenlong Shi, Jianxun Lian, Mingqi Wu +5Large Language Model-Based Role-Play SimulationPersonality Modeling in Language Models

  8. TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

    May 16, 2026Zhiqiang Liu, Wenhui Dong, Yilang Tan +3Tool-Use EvaluationAI Agent Benchmarks

  9. The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

    May 16, 2026Yuxuan Ye, Jun Han, Ao Hu +7LLM Agent EvaluationAI Agent Benchmarks

  10. CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

    May 15, 2026Haolin Chen, Deon Metelski, Leon Qi +30HealthcareLong-Horizon Agent Evaluation

  11. MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility

    May 15, 2026Sasi Kiran Gaddipati, Diyana Muhammed, Farhana Keya +2AI Agent BenchmarksML Reproducibility

  12. ColPackAgent: Agent-Skill-Guided Hard-Particle Monte Carlo Workflows for Colloidal Packing

    May 15, 2026Lijie Ding, Changwoo DoAgentic WorkflowsAI Agent Benchmarks

  13. XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

    May 14, 2026Gong Zhiren, Tiantong Wu, Jiaming Zhang +9AI for ScienceLLM Evaluation

  14. ππ-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

    May 14, 2026Haoran Zhang, Luxin Xu, Zhilin Wang +11Long-Horizon Agent EvaluationAI Agent Benchmarks

  15. TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

    May 14, 2026Pei Yang, Wanyi Chen, Tongyun Yang +15Benchmark DesignLLM Agent Evaluation

  16. GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations

    May 14, 2026Jingbo Yang, Kwei-Herng Lai, Xiaowen Wang +3Conversational MemoryLLM Agent Evaluation

  17. SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

    May 14, 2026Man Ho Lam, Chaozheng Wang, Hange Liu +5Software Engineering AgentsSoftware Engineering Benchmarks

  18. Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows

    May 14, 2026Zixin Chen, Peng Liu, Rui Sheng +6Intelligent Tutoring SystemsEducational Assessment