AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. Measuring Biological Capabilities and Risks of AI Agents

    Jun 18, 2026Patricia Paskov, Jeffrey Lee, Kyle Brady +1AI for ScienceAI Agent Evaluation

  2. TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

    Jun 17, 2026Hannah Le, Ramesh Ramasamy, Alex Urrutia +3AI Agent EvaluationAI Agent Benchmarks

  3. RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

    Jun 16, 2026Weizhi Zhang, Zechen Li, Hamid Palangi +16AI Agent EvaluationHuman-in-the-Loop Evaluation

  4. Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

    Jun 16, 2026Jasmine Brazilek, Joel Christoph, Maheep Chaudhary +4AI Agent EvaluationAI Agent Safety

  5. Offline Preference-Based Trajectory Evaluation

    Jun 16, 2026Fernando DiazAI Agent EvaluationAI Agent Benchmarks

  6. Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

    Jun 15, 2026Zewen LiuAI Agent EvaluationMultimodal Model Evaluation

  7. Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

    Jun 11, 2026Pratham Singla, Shivank Garg, Vihan SinghGame-Playing AgentsStrategic Reasoning Risks in Language Models

  8. AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

    Jun 11, 2026Xiaoyuan Liu, Jianhong Tu, Yuqi Chen +26Software Engineering AgentsAI Agent Evaluation

  9. EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis

    Jun 11, 2026Harihara Muralidharan, Reema Baskar, Soo Hee Lee +2AI Agents for Scientific DiscoveryAI Agent Evaluation

  10. Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

    Jun 11, 2026Zihao Wang, Yiming Li, Yutong Wu +8AI Agent EvaluationLLM Agent Security

  11. The Illusion of Multi-Agent Advantage

    Jun 11, 2026Prathyusha Jwalapuram, Hehai Lin, Chuyuan Li +7AI Agent EvaluationAgent Evaluation

  12. Benchmarking AI Agents for Addressing Scientific Challenges Across Scales

    Jun 10, 2026Tianyu Liu, Allen Xin Wang, Antonia Panescu +30AI for ScienceAI Agent Evaluation

  13. Can AI Agents Synthesize Scientific Conclusions?

    Jun 9, 2026Hayoung Jung, Pedro Viana Diniz, José Reinaldo Corrêa Roveda +5AI Agent EvaluationAI Agent Benchmarks

  14. VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation

    Jun 9, 2026Yunan Lu, Ryan Shea, Yusen Zhang +1Human Behavior SimulationAI Agent Evaluation

  15. Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

    Jun 8, 2026Rishabh Sabharwal, Hongru Wang, Amos Storkey +1Deep Research AgentsAI Agent Evaluation

  16. Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

    Jun 7, 2026Aman Gupta, Kevin Rossell, Edesio Alcobaça +8Customer Support AutomationLLM Agent Evaluation

  17. A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

    Jun 5, 2026Kai A. Horstmann, Ethan Lin, Alice A. Robie +2AI Agent EvaluationScientific Code Generation

  18. Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

    Jun 5, 2026Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori +3Reward HackingCoding Agents

  19. The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

    Jun 5, 2026Xiaoou Liu, Tiejin Chen, Weibo Li +2Sim-to-Real TransferAI Agent Evaluation

  20. MacArena: Benchmarking Computer Use Agents on an Online macOS Environment

    Jun 4, 2026Victor Muryn, Maksym Shamrai, Sofiia Mazepa +1Computer-Use Agent BenchmarksComputer-Use Agents

  21. Be Fair! Can Machine Learning Engineering Agents Adhere to Fairness Constraints?

    Jun 3, 2026Anna Richter, Julia Stoyanovich, Sebastian SchelterAlgorithmic FairnessAI Agent Evaluation

  22. Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning

    Jun 2, 2026Eric Cho, Shawn Huang, Alice Lu +1Quantitative FinanceAI Agent Evaluation