Agent Evaluation

Momentum

23 papers in the last four weeks, up 229% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 97

All topics
CardsList
  1. Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

    Jun 8, 2026Rishabh Sabharwal, Hongru Wang, Amos Storkey +1Deep Research AgentsAI Agent Evaluation

  2. FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

    Jun 3, 2026Nicholas SabanLLM EvaluationAgent Evaluation

  3. What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents

    Jun 1, 2026Victor Ojewale, Suresh VenkatasubramanianAgent EvaluationAI Agent Safety

  4. Tracking the Behavioral Trajectories of Adapting Agents

    Jun 1, 2026Jonah Leshin, Manish Shah, Ian TimmisAgent EvaluationAI Agent Monitoring

  5. TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

    May 31, 2026Yaxuan Kong, Qingren Yao, Yuqi Nie +7Time Series ReasoningLLM Agent Evaluation

  6. Proper Scoring Rules for Agentic Uncertainty Quantification

    May 23, 2026Suresh Raghu, Satwik Pandey, Shashwat PandeyUncertainty QuantificationAgent Evaluation

  7. AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

    May 21, 2026Hanjun Luo, Zhimu Huang, Sylvia Chung +6T2I GenerationAgent Evaluation

  8. Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows

    May 14, 2026Zixin Chen, Peng Liu, Rui Sheng +6Intelligent Tutoring SystemsEducational Assessment

  9. ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

    May 13, 2026Yuxiang Lai, Peng Xia, Haonian Ji +8Computer-Use Agent BenchmarksLLM Agent Evaluation

  10. AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

    May 13, 2026Hailin Zhong, Shengxin ZhuSoftware Engineering AgentsAgent Evaluation

  11. AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

    May 13, 2026Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4Agent Failure AnalysisSoftware Engineering Agents

  12. Rollout Cards: A Reproducibility Standard for Agent Research

    May 12, 2026Charlie Masters, Ziyuan Liu, Stefano V. AlbrechtAI Agent EvaluationAgent Evaluation

  13. An Empirical Study of Automating Agent Evaluation

    May 12, 2026Kang Zhou, Sangmin Woo, Haibo Ding +15Agent EvaluationAI Agent Benchmarks

  14. WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

    May 11, 2026Shuangrui Ding, Xuanlang Dai, Long Xing +14Computer-Use Agent BenchmarksTool-Augmented Language Model Agents

  15. Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

    May 8, 2026Zhengyang Tang, Yi Zhang, Chenxin Li +18Computer-Use AgentsAgent Evaluation

  16. AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair

    May 6, 2026Yuelin Hu, Zhenbo Yu, Zhengxue Cheng +2AI Agent AuditingAgent Evaluation

  17. Learning Correct Behavior from Examples: Validating Sequential Execution in Autonomous Agents

    May 4, 2026Reshabh K Sharma, Gaurav Mittal, Yu HuAutomated Software TestingAgent Evaluation

  18. Intervention Complexity as a Canonical Reward and a Measure of Intelligence

    May 4, 2026Brendan McCaneAgent EvaluationReward Design for RL

  19. Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

    Apr 30, 2026Chunhui Zhang, Yuxuan Wang, Aoyang Qin +4Hierarchical PlanningAgent Evaluation

  20. AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

    Apr 26, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuAgent Failure AnalysisAI Agent Evaluation

  21. ClawEnvKit: Automatic Environment Generation for Claw-Like Agents

    Apr 20, 2026Xirui Li, Ming Li, Ion Stoica +2Agent EvaluationAI Agent Benchmarks

  22. The Hitchhikers Guide to Rubric Quality Understanding and Enrichment

    Apr 1, 2026Ankit Aich, Zhengyang Qi, Charles Dickens +7Agent EvaluationPsychometric Validation