AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. The DeepSpeak-Agentic Dataset

    Jun 2, 2026Sarah Barrington, Maty Bohacek, Hany FaridAI Agent EvaluationHuman-AI Interaction

  2. RobotValues: Evaluating Household Robots When Human Values Conflict

    Jun 2, 2026Jongwook Han, Hyeongjin Kim, Yohan JoAI Agent EvaluationVLMs for Robotics

  3. AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents

    Jun 1, 2026Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda +3Continual Learning for LLM AgentsAI Agent Evaluation

  4. HLL: Can Agents Cross Humanity's Last Line of Verification?

    Jun 1, 2026Xinhao Song, Su Su, Sirui Song +6GUI AgentsAI Agent Evaluation

  5. SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

    Jun 1, 2026Hao Cheng, Changtao Miao, Tianle Song +21AI Agent EvaluationLLM Agent Security

  6. AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

    Jun 1, 2026Junqi Liu, Selena Song, Yuhan Wang +12AI Agent EvaluationAI Agent Benchmarks

  7. TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

    May 29, 2026Junjie Nian, Kang Chen, Ge Zhang +2Agent ReliabilitySoftware Engineering Benchmarks

  8. Design Principles for Human-Agent Interaction

    May 28, 2026Haiyi Zhu, Canwen Wang, Qing Xiao +1AI Agent EvaluationHuman-AI Interaction

  9. Gram: Assessing sabotage propensities via automated alignment auditing

    May 28, 2026David Lindner, Victoria Krakovna, Sebastian FarquharAI Coding AgentsAI Agent Auditing

  10. Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems

    May 28, 2026Lorenz Kutschka, Bernhard GeigerTool-Augmented Language Model AgentsAI Agent Evaluation

  11. WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

    May 28, 2026Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu +14Multimodal MemoryLLM Agent Memory

  12. Paper Agents, Paper Gains: An Empirical Analysis of DeFi Investment Agents

    May 27, 2026Jay Yu, Amy Zhao, Danning SuiFinancial ServicesAI Agent Evaluation

  13. First head-to-head comparison of agentic AI applied to the analysis of simulated data of the Einstein Telescope

    May 27, 2026Gianluca IngugliaAI Agents for Scientific DiscoveryAI Agent Evaluation

  14. AI Research Agents Narrow Scientific Exploration

    May 27, 2026Yixuan Tang, Yi YangAI Agents for Scientific DiscoveryAI Agent Evaluation

  15. VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

    May 26, 2026Yuxin Chen, Yi Zhang, Zhengzhou Cai +11LLM Agent MemoryAI Agent Evaluation

  16. Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents

    May 25, 2026Haoyi Hu, Qirong Lyu, Xianghan Kong +7AI Agent EvaluationAI Agent Benchmarks

  17. Behind EvoMap: Characterizing a Self-Evolving Agent-to-Agent Collaboration Network

    May 25, 2026Qiming Ye, Peixain Zhang, Yupeng He +2AI Agent EvaluationMulti-Agent Collaboration

  18. Insuring Every Action: An Authority Frontier Framework for Runtime Actuarial Control of Autonomous AI Agents

    May 25, 2026Hao-Hsuan ChenAI Risk ManagementAI Agent Evaluation

  19. AION: Next-Generation Tasks and Practical Harness for Time Series

    May 24, 2026Tianxiang Zhan, Xiaobao Song, Tong Guan +2Time Series ReasoningTime Series Forecasting

  20. The Open Source Economic Index of AI Adoption and Capability

    May 23, 2026Seamus Somerstep, Aritra Guha, Divesh Srivastava +1AI Agent EvaluationAI Agent Benchmarks

  21. AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery

    May 22, 2026Darek Kleczek, Fuheng Zhao, Alexander W. Lee +4AI Agent EvaluationAI Agent Benchmarks

  22. Design and Report Benchmarks for Knowledge Work

    May 22, 2026Yining Hua, Hongbin Na, Cyrus Ayubcha +1Benchmark DesignAI Agent Evaluation

  23. Advancing Mathematics Research with AI-Driven Formal Proof Search

    May 21, 2026George Tsoukalas, Anton Kovsharov, Sergey Shirobokov +18Automated Theorem ProvingAI Agent Evaluation

  24. Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard

    May 21, 2026Sahar Abdelnabi, Chris Hicks, Konrad Rieck +1AI Agent EvaluationAI Agent Security

  25. Towards Direct Evaluation of Harness Optimizers via Priority Ranking

    May 21, 2026Kai Tzu-iunn Ong, Minseok Kang, Dongwook Choi +11AI Agent EvaluationAgent Harness Optimization