AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

    Jun 22, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangAI Agent EvaluationIndirect Prompt Injection

  2. Autonomous Event-Driven Multi-Agent Orchestration for Enterprise AI at Scale

    Jun 18, 2026Harsh Rao Dhanyamraju, Leonidas Raghav, Aaron LeeMulti-Agent OrchestrationAI Agent Evaluation

  3. Measuring Biological Capabilities and Risks of AI Agents

    Jun 18, 2026Patricia Paskov, Jeffrey Lee, Kyle Brady +1AI for ScienceAI Agent Evaluation

  4. TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

    Jun 17, 2026Hannah Le, Ramesh Ramasamy, Alex Urrutia +3AI Agent EvaluationAI Agent Benchmarks

  5. RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

    Jun 16, 2026Weizhi Zhang, Zechen Li, Hamid Palangi +16AI Agent EvaluationHuman-in-the-Loop Evaluation

  6. Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

    Jun 16, 2026Jasmine Brazilek, Joel Christoph, Maheep Chaudhary +4AI Agent EvaluationAI Agent Safety

  7. Offline Preference-Based Trajectory Evaluation

    Jun 16, 2026Fernando DiazAI Agent EvaluationAI Agent Benchmarks

  8. Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

    Jun 15, 2026Zewen LiuAI Agent EvaluationMultimodal Model Evaluation

  9. Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

    Jun 11, 2026Pratham Singla, Shivank Garg, Vihan SinghGame-Playing AgentsStrategic Reasoning Risks in Language Models

  10. AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

    Jun 11, 2026Xiaoyuan Liu, Jianhong Tu, Yuqi Chen +26Software Engineering AgentsAI Agent Evaluation

  11. EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis

    Jun 11, 2026Harihara Muralidharan, Reema Baskar, Soo Hee Lee +2AI Agents for Scientific DiscoveryAI Agent Evaluation

  12. Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

    Jun 11, 2026Zihao Wang, Yiming Li, Yutong Wu +8AI Agent EvaluationLLM Agent Security

  13. The Illusion of Multi-Agent Advantage

    Jun 11, 2026Prathyusha Jwalapuram, Hehai Lin, Chuyuan Li +7AI Agent EvaluationAgent Evaluation

  14. Benchmarking AI Agents for Addressing Scientific Challenges Across Scales

    Jun 10, 2026Tianyu Liu, Allen Xin Wang, Antonia Panescu +30AI for ScienceAI Agent Evaluation

  15. Can AI Agents Synthesize Scientific Conclusions?

    Jun 9, 2026Hayoung Jung, Pedro Viana Diniz, José Reinaldo Corrêa Roveda +5AI Agent EvaluationAI Agent Benchmarks

  16. VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation

    Jun 9, 2026Yunan Lu, Ryan Shea, Yusen Zhang +1Human Behavior SimulationAI Agent Evaluation

  17. Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

    Jun 8, 2026Rishabh Sabharwal, Hongru Wang, Amos Storkey +1Deep Research AgentsAI Agent Evaluation

  18. Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

    Jun 7, 2026Aman Gupta, Kevin Rossell, Edesio Alcobaça +8Customer Support AutomationLLM Agent Evaluation

  19. A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

    Jun 5, 2026Kai A. Horstmann, Ethan Lin, Alice A. Robie +2AI Agent EvaluationScientific Code Generation

  20. Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

    Jun 5, 2026Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori +3Reward HackingCoding Agents

  21. The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

    Jun 5, 2026Xiaoou Liu, Tiejin Chen, Weibo Li +2Sim-to-Real TransferAI Agent Evaluation