Agentic Evaluations

Latest papers 141

All topics
CardsList
  1. EIO-Agents: The Missing Semantic Layer for AI Agent Evaluation

    Oct 6, 2026Fouad BousetouaneAgentic Evaluations

  2. Inspect Robots: Evaluating the Capabilities and Safety of Embodied AI

    Oct 5, 2026Christopher Leet, Achu Menon, Sravanthi Machcha +12Agentic Evaluations

  3. Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills

    Oct 1, 2026Ngoc Phuoc An Vo, Aarya Doshi, Vadim SheininAgentic EvaluationsReusable Agent Skills

  4. Agents Are Systems, Not Models: Rethinking Agentic Evaluation

    Oct 1, 2026Luis Wiedmann, Leander Girrbach, Cordelia Schmid +1Agentic EvaluationsSelf-Verification

  5. Auditing Web Agent Evaluation on WebArena-Lite: Human Review of Outcomes and Trajectories

    Oct 1, 2026Chengguang Gan, Zimeng He, Yoshihiro Tsujii +3Web AgentsAgentic Evaluations

  6. AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation

    Oct 1, 2026Giulio Zeloni, Enrico Lo Conte, Salvatore Rionero +3Agentic EvaluationsLarge Language Model Judges

  7. Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard

    Sep 30, 2026Michael Hardy, Ruhana Azam, Anka Reuel +2Agentic EvaluationsScaffolds

  8. From Verification Failures to Reusable Guidance for Coding Agents

    Sep 30, 2026Yuqing Zhai, Xiaohong Chen, Lingming Zhang +2Coding AgentsAgentic Evaluations

  9. Certified Selective Automation of LLM Agent Evaluation

    Sep 28, 2026Chengguang Gan, Yunhao Liang, Qinghao Zhang +1Agentic EvaluationsAutomated

  10. Learning Strategies to Break Judges

    Sep 27, 2026Guruprerana Shabadi, Aaditya Naik, Rajeev Alur +1JudgesAgentic Evaluations

  11. Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents

    Sep 23, 2026Saeedeh Lohrasbi, Mohammad Mamun, Ahmed Yehia +2Multi-Llm AgentsAgentic Evaluations

  12. Discover, Falsify, Revise: Auditing Input-Use Claims from Source Code to Predictive Contribution in Agent-Discovered Cell Models

    Sep 23, 2026Mengran Li, Bo Li, Chengyang Zhang +3Virtual CellModel Auditing

  13. ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions

    Sep 16, 2026Guosen Wu, Huizhen Huang, Guoxiong Long +2PrivacyAgentic Evaluations

  14. PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?

    Sep 16, 2026Mika Okamoto, Ansel Kaplan ErolComplianceAgentic Evaluations

  15. Bad Genius: Counterfactual-Guided Harness Evolution Beyond Task-Specific Shortcuts

    Sep 16, 2026Guojun Zhu, Xunheng Huang, Peng Yin +3Agentic EvaluationsAdversarial Evaluation

  16. Skill-based Agentic Evaluation for Real-time Data Science Tasks

    Sep 15, 2026Aniruddha Tamhane, Raghavendra Addanki, Ayushi Aggarwal +4Data Science AgentsAgentic Evaluations

  17. The Convention Gap: Towards Measuring Implicit Communication in Cooperative AI Evaluation

    Sep 10, 2026Makoto Fukushima, Hua-Dong Xiong, Ehsan Moradi PariAgentic EvaluationsArtificial Intelligence Benchmarks

  18. No Free Checker: A Survey of Verifiers for Robot Policies

    Sep 10, 2026Yang Wan, Xihang Yue, Zhirui Liu +7Verification FrameworkPolicy Evaluation

  19. Agentic Empirical Asset Pricing: Methodological Foundations

    Sep 1, 2026Yingjian Pan, Xiaowei Ding, Kay GieseckeAgentic EvaluationsEconomies

  20. Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

    Aug 31, 2026Xuehai Wang, Haowei Qin, Tongxin Liu +6Research AutomationRubrics

  21. Selection-Aware Stress Testing for Interactive Agents

    Aug 31, 2026Yang Xu, Chenang Li, Jiefu Zhang +3Stress TestingAgentic Evaluations

  22. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

    Aug 31, 2026Wei Chen, Peilun Zhou, Zhaoyu Hu +8Agentic EvaluationsAtlas

  23. A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption

    Aug 26, 2026Yegor Denisov-Blanch, Shyam Agarwal, Pavel Azaletskiy +5Coding AgentsAgentic Evaluations

  24. RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level

    Aug 13, 2026Juan Irving Vasquez, Juan Terven, Laura-Ivoone Garay-JimenezReadinessArtificial Intelligence Systems

  25. Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

    Aug 10, 2026Shulin Tian, Ziqi Huang, Fan Zhang +3Agentic EvaluationsEvaluation Agent

  26. Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents

    Aug 10, 2026Neel Tushar Shah, Manglam Kartik, Akshat KarkarCooperationFrontier Large Language Model Agents

  27. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Agent HarnessAgentic Evaluations

  28. SkillEval: Decomposing Agent Skill Quality into Interpretable Signals

    Aug 7, 2026Jiahui Han, Qinuo Li, Ziheng Peng +6Agent Skill RetrievalSkills

  29. What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

    Aug 5, 2026Tao Li, Junfeng Liu, Qinghua Zhao +5SkillsAgentic Evaluations

  30. Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

    Aug 2, 2026Tezan Sahu, Aritra Das, Pankaj Mittal +1Agentic EvaluationsData-Curation

  31. How Benchmarks Mis-Score Computer-Use Agents

    Jul 30, 2026Zihan Dong, Zhiyuan Ma, Zekun Wang +5Computer-Use AgentsAgentic Evaluations

  32. Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

    Jul 30, 2026Phuc Pham, Truong-Son HyBioinformaticsAgentic Workflows

  33. Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

    Jul 28, 2026Abu Bakar SiddikCybersecurityModel Vulnerabilities

  34. GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

    Jul 27, 2026Jiacheng Lu, Sinuo Wang, Wentao Zhao +12Finance BenchmarksGrading

  35. Agentic Evaluation of Copyright Law Compliance

    Jul 23, 2026Zheng Hui, Doni Bloomfield, Noam KoltCopyright DefensesLarge Language Model Agents