AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents

    Sep 11, 2026Toshiaki Koike-Akino, Vladislav Blaykhman, Ye Wang +2LLM Self-RefinementLLM-as-a-Judge

  2. Overview of the NLPCC 2026 Shared Task 11: Agent-Based Experiment Reproduction from Scientific Papers

    Sep 11, 2026Hanhua Hong, Yizhi Li, Luu Gia Huy +3AI Agent EvaluationAgent Evaluation

  3. The Convention Gap: Towards Measuring Implicit Communication in Cooperative AI Evaluation

    Sep 10, 2026Makoto Fukushima, Hua-Dong Xiong, Ehsan Moradi PariGame-Playing AgentsAI Agent Evaluation

  4. Safe to Stop? Risk-Constrained Stopping for Sequential Clinical Diagnosis Agents

    Sep 9, 2026Yuexin Wu, Vasile RusSelective PredictionAI Agent Evaluation

  5. AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era

    Sep 7, 2026Yunxiang Mo, Tianshi Zheng, Yisen Gao +7AI for ScienceAI Agent Evaluation

  6. Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents

    Sep 7, 2026Jingjie Ning, Shanshan Zhong, Xiaochuan Li +1AI Agents for Scientific DiscoveryAlgorithmic Auditing

  7. PatchBench: Evaluating AI Agents for Vulnerability Patching

    Sep 3, 2026Chihao Shen, Jiacheng Li, Aastha Mahajan +3Automated Program RepairNeural Network Memorization

  8. Interface-Induced Trajectory Censoring

    Sep 3, 2026Wenbo WangTool-Use EvaluationAI Agent Evaluation

  9. READY or Not: Reliable Enterprise Agent Deployment

    Sep 2, 2026Veronica Chatrath, Bryan Zhu, Jingxuan Fan +15AI Agent Evaluation

  10. Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation

    Sep 1, 2026Kefeng Duan, Dewu Zheng, Yanlin Wang +7Software Engineering BenchmarksLLM Agent Evaluation

  11. Agentic Empirical Asset Pricing: Methodological Foundations

    Sep 1, 2026Yingjian Pan, Xiaowei Ding, Kay GieseckeQuantitative FinanceAI Agent Evaluation

  12. Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

    Aug 31, 2026Xuehai Wang, Haowei Qin, Tongxin Liu +6AI Agent EvaluationAutonomous Scientific Discovery

  13. MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

    Aug 31, 2026Vernon Toh, Navonil Majumder, Zhengyuan Liu +2Active PerceptionAI Agent Evaluation

  14. Selection-Aware Stress Testing for Interactive Agents

    Aug 31, 2026Yang Xu, Chenang Li, Jiefu Zhang +3AI Agent EvaluationMultiple Hypothesis Testing

  15. BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

    Aug 31, 2026Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs +3Reward HackingAI Agent Evaluation

  16. Science sandboxes measure the scientific capability of AI agents

    Aug 31, 2026Arya S. Rao, Rodrigo I. Castro, Sager J. Gosai +8Protein Fitness PredictionAI Agent Evaluation

  17. Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment

    Aug 30, 2026Zhiyu Chen, Keyu Zhao, Jigao Fu +8AI Agents for Scientific DiscoveryLLM-as-a-Judge

  18. CatchBench: When Can an Agent Failure Be Caught?

    Aug 24, 2026Yue Zhao, Mengyuan Li, Ruolin Li +5Agent Failure AnalysisBenchmark Auditing

  19. What is Missing from AI Post-Training AI: An Empirical Analysis

    Aug 19, 2026Joy Jia Yin Lim, Xin Huang, Hao Peng +5AI Agent EvaluationLLM Agent Self-Improvement

  20. Science Done on a Machine by a Machine: AI Agents in Computational Chemistry

    Aug 19, 2026Pavlo O. Dral, Hassan Nawaz, Arif UllahAI Agents for Scientific DiscoveryAI Agent Evaluation

  21. DiG-bench: Discovery in Games

    Aug 12, 2026Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan +13Benchmark DesignAI Agent Evaluation

  22. ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

    Aug 12, 2026Yutao Mou, Pengfei Yang, Zhe Yin +6AI Agent EvaluationAdversarial Scenario Generation