AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

    Apr 28, 2026Shivam Rawat, Lucie FlekAgent Failure AnalysisAI for Science

  2. ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

    Apr 28, 2026Sidi Chang, Peiying Zhu, Yuxiao ChenLLM-as-a-JudgeAI Agent Evaluation

  3. Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents

    Apr 28, 2026Jianming Chen, Yawen Wang, Junjie Wang +4Agent Failure AnalysisAI Agent Evaluation

  4. Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

    Apr 27, 2026Joshua Sherwood, Ben Aybar, Benjamin KaplanAI Coding AgentsAI Agent Evaluation

  5. OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

    Apr 27, 2026Zheng Wu, Yi Hua, Zhaoyuan Huang +8Computer-Use AgentsAI Agent Evaluation

  6. AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

    Apr 27, 2026Yuxuan Gao, Megan Wang, Yi Ling YuAI Agent EvaluationAI Agent Benchmarks

  7. Failure-Centered Runtime Evaluation for Deployed Trilingual Public-Space Agents

    Apr 27, 2026M. MengAgent Failure AnalysisAutomated Software Testing

  8. AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

    Apr 26, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuAgent Failure AnalysisAI Agent Evaluation

  9. Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

    Apr 24, 2026Xirui Li, Ming Li, Yunze Xiao +4Multi-Agent CoordinationAI Agent Evaluation

  10. AgentSearchBench: A Benchmark for AI Agent Search in the Wild

    Apr 24, 2026Bin Wu, Arastun Mammadli, Xiaoyu Zhang +1Agentic SearchAI Agent Evaluation

  11. MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

    Apr 22, 2026Yingyong Hou, Xinyuan Lao, Huimei Wang +10HealthcareAI-Assisted Scientific Research

  12. Information Aggregation with AI Agents

    Apr 21, 2026Spyros GalanisAI Agent EvaluationMulti-Agent Reasoning

  13. How Adversarial Environments Mislead Agentic AI?

    Apr 20, 2026Zhonghao Zhan, Huichi Zhou, Zhenhao Li +3Adversarial RobustnessAI Agent Evaluation

  14. AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

    Apr 20, 2026Wentao Shi, Yu Wang, Yuyang Zhao +8LLM-as-a-JudgeLLM Agent Evaluation

  15. CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks

    Apr 20, 2026Yijia Shao, Zora Zhiruo Wang, Neel Ahuja +3AI Agent EvaluationHuman-in-the-Loop Evaluation

  16. HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution

    Apr 20, 2026Hanhua Hong, Yizhi LI, Jiaoyan Chen +4Multi-Agent LLM SystemsCode Generation

  17. Mini-BEHAVIOR-Gran: Revealing U-Shaped Effects of Instruction Granularity on Language-Guided Embodied Agents

    Apr 18, 2026Sukai Huang, Chenyuan Zhang, Fucai Ke +4AI Agent EvaluationAI Agent Benchmarks

  18. PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

    Apr 18, 2026Manasa Bharadwaj, Yolanda Liu, InJung Yang +5AI Agent EvaluationMultimodal Agents

  19. Agentic Frameworks for Reasoning Tasks: An Empirical Study

    Apr 17, 2026Zeeshan Rasheed, Abdul Malik Sami, Muhammad Waseem +3LLM Agent OrchestrationAI Agent Evaluation

  20. MOSAIC: A Universal Agent-Level Interface for Cross-Paradigm Agent Mixing and Human-AI Collaboration

    Mar 1, 2026Abdulhamid M. Mousa, Jinhui Pang, Rakhmonberdi Khajiev +5AI Agent EvaluationAgent Evaluation

  21. AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

    Feb 26, 2026Abhay Sheshadri, Aidan Ewart, Elias Kempf +8Benchmark AuditingAI Agent Evaluation

  22. JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

    Feb 6, 2026Lanbo Lin, Jiayao Liu, Tianyuan Yang +5LLM-as-a-JudgeAI Agent Evaluation

  23. Persuasion Propagation: Does Persuasion Change AI Agent Behavior?

    Jan 31, 2026Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein +1Persuasion in Language ModelsAI Agent Evaluation

  24. LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

    Jan 20, 2026Jianan Wang, Siyang Zhang, Bin Li +4Robotics SimulationAI Agent Evaluation

  25. DR-Arena: an Automated Evaluation Framework for Deep Research Agents

    Jan 15, 2026Yiwen Gao, Ruochen Zhao, Yang Deng +1Deep Research AgentsBenchmark Design

  26. Monte Carlo Query Search: Active Capability Assessment of AI Agents

    Dec 18, 2025Daniel Bramblett, Rushang Karia, Adrian Ciotinga +3AI Agent EvaluationActive Learning

  27. Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

    Nov 24, 2025Dayong Liu, Chao Xu, Weihong Chen +5AI Agent EvaluationMultimodal Large Language Models

  28. TripScore: Aligning LLMs for Real-World Travel Planning via Expert-Calibrated Reward

    Oct 10, 2025Yincen Qu, Huan Xiao, Feng Li +5Reward ModelingLLM Planning

  29. AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

    Jun 4, 2025Dhaval Patel, Shuxin Lin, James Rayfield +7LLM Agent OrchestrationAI Agent Evaluation

  30. When AI Meets Finance (StockAgent): Large Language Model-based Stock Trading in Simulated Real-world Environments

    Jul 15, 2024Chong Zhang, Xinyi Liu, Zhongmou Zhang +10Multi-Agent LLM SystemsHuman Behavior Simulation

  31. SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

    Date pendingYuqiao Tan, Shizhu He, Jun Zhao +1AI Agent EvaluationSparse Autoencoders

  32. An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

    Date pendingHong Zhang, Barry Smith, Satish Balay +4High-Performance ComputingCode Generation

  33. Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

    Date pendingWilliam CabanInter-Rater ReliabilityAI Agent Evaluation

  34. EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

    Date pendingTara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz +10Voice Agent EvaluationSpoken Dialogue Systems