AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

    Apr 28, 2026Shivam Rawat, Lucie FlekAgent Failure AnalysisAI for Science

  2. ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

    Apr 28, 2026Sidi Chang, Peiying Zhu, Yuxiao ChenLLM-as-a-JudgeAI Agent Evaluation

  3. Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents

    Apr 28, 2026Jianming Chen, Yawen Wang, Junjie Wang +4Agent Failure AnalysisAI Agent Evaluation

  4. Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

    Apr 27, 2026Joshua Sherwood, Ben Aybar, Benjamin KaplanAI Coding AgentsAI Agent Evaluation

  5. OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

    Apr 27, 2026Zheng Wu, Yi Hua, Zhaoyuan Huang +8Computer-Use AgentsAI Agent Evaluation

  6. AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

    Apr 27, 2026Yuxuan Gao, Megan Wang, Yi Ling YuAI Agent EvaluationAI Agent Benchmarks

  7. Failure-Centered Runtime Evaluation for Deployed Trilingual Public-Space Agents

    Apr 27, 2026M. MengAgent Failure AnalysisAutomated Software Testing

  8. AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

    Apr 26, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuAgent Failure AnalysisAI Agent Evaluation

  9. Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

    Apr 24, 2026Xirui Li, Ming Li, Yunze Xiao +4Multi-Agent CoordinationAI Agent Evaluation

  10. AgentSearchBench: A Benchmark for AI Agent Search in the Wild

    Apr 24, 2026Bin Wu, Arastun Mammadli, Xiaoyu Zhang +1Agentic SearchAI Agent Evaluation

  11. MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

    Apr 22, 2026Yingyong Hou, Xinyuan Lao, Huimei Wang +10HealthcareAI-Assisted Scientific Research

  12. Information Aggregation with AI Agents

    Apr 21, 2026Spyros GalanisAI Agent EvaluationMulti-Agent Reasoning

  13. How Adversarial Environments Mislead Agentic AI?

    Apr 20, 2026Zhonghao Zhan, Huichi Zhou, Zhenhao Li +3Adversarial RobustnessAI Agent Evaluation

  14. AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

    Apr 20, 2026Wentao Shi, Yu Wang, Yuyang Zhao +8LLM-as-a-JudgeLLM Agent Evaluation

  15. CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks

    Apr 20, 2026Yijia Shao, Zora Zhiruo Wang, Neel Ahuja +3AI Agent EvaluationHuman-in-the-Loop Evaluation

  16. HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution

    Apr 20, 2026Hanhua Hong, Yizhi LI, Jiaoyan Chen +4Multi-Agent LLM SystemsCode Generation

  17. Mini-BEHAVIOR-Gran: Revealing U-Shaped Effects of Instruction Granularity on Language-Guided Embodied Agents

    Apr 18, 2026Sukai Huang, Chenyuan Zhang, Fucai Ke +4AI Agent EvaluationAI Agent Benchmarks

  18. PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

    Apr 18, 2026Manasa Bharadwaj, Yolanda Liu, InJung Yang +5AI Agent EvaluationMultimodal Agents

  19. Agentic Frameworks for Reasoning Tasks: An Empirical Study

    Apr 17, 2026Zeeshan Rasheed, Abdul Malik Sami, Muhammad Waseem +3LLM Agent OrchestrationAI Agent Evaluation

  20. MOSAIC: A Universal Agent-Level Interface for Cross-Paradigm Agent Mixing and Human-AI Collaboration

    Mar 1, 2026Abdulhamid M. Mousa, Jinhui Pang, Rakhmonberdi Khajiev +5AI Agent EvaluationAgent Evaluation

  21. AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

    Feb 26, 2026Abhay Sheshadri, Aidan Ewart, Elias Kempf +8Benchmark AuditingAI Agent Evaluation

  22. JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

    Feb 6, 2026Lanbo Lin, Jiayao Liu, Tianyuan Yang +5LLM-as-a-JudgeAI Agent Evaluation

  23. Persuasion Propagation: Does Persuasion Change AI Agent Behavior?

    Jan 31, 2026Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein +1Persuasion in Language ModelsAI Agent Evaluation

  24. LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

    Jan 20, 2026Jianan Wang, Siyang Zhang, Bin Li +4Robotics SimulationAI Agent Evaluation

  25. DR-Arena: an Automated Evaluation Framework for Deep Research Agents

    Jan 15, 2026Yiwen Gao, Ruochen Zhao, Yang Deng +1Deep Research AgentsBenchmark Design

  26. Monte Carlo Query Search: Active Capability Assessment of AI Agents

    Dec 18, 2025Daniel Bramblett, Rushang Karia, Adrian Ciotinga +3AI Agent EvaluationActive Learning