Agent Evaluation

Momentum

23 papers in the last four weeks, up 229% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 97

All topics
CardsList
  1. SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

    Aug 7, 2026Chaofan Meng, Yuhang Zheng, Yingnan Zhou +1Agent EvaluationAgent Skill Security Auditing

  2. What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

    Aug 5, 2026Tao Li, Junfeng Liu, Qinghua Zhao +5Agent EvaluationShapley Value Attribution

  3. Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

    Aug 3, 2026Shicheng Fan, Mingdai Yang, Duohao Wang +9AI Agent EvaluationAgent Evaluation

  4. Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

    Aug 3, 2026Yuwen Wang, Tian-Hao Zhang, Minghao Cai +7Tool-Augmented Language Model AgentsAgent Evaluation

  5. ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

    Aug 2, 2026Jie Gong, Maowei Jiang, Zhiwei Liu +14Financial ServicesLong-Horizon Agent Evaluation

  6. CurveShift: Is Agent Progress Scalar? Separating Level from Shape

    Jul 31, 2026Hanwen Xing, Pengyun Wang, BingXu Meng +8LLM EvaluationAgent Evaluation

  7. MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing

    Jul 31, 2026Natan Vidra, Alina Kapanova, Arun Kanhai +1Agentic WorkflowsAgent Evaluation

  8. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Jul 30, 2026Yuhang Zhu, Mingxuan Du, Benfeng Xu +3LLM EvaluationLarge Language Model-Based Role-Play Simulation

  9. Evidence-Ledger Adjudication for Claim-Evidence Traceability

    Jul 29, 2026Gengyu Chen, Yongjie Yu, Weiling WangClaim VerificationCitation Verification

  10. Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

    Jul 28, 2026Stefan Krsteski, Charlotte Meyer, Guillaume Allegre +2AI Agent EvaluationAgent Evaluation

  11. Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

    Jul 27, 2026Jingkun Luo, Da-Tian PengData ProvenanceBenchmark Auditing

  12. SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data

    Jul 22, 2026Zenghui Zhou, Xiaoyang Li, Xiaoxuan Qiao +2Synthetic Data GenerationAgent Evaluation

  13. OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

    Jul 16, 2026Chengyu Shen, Yujie Fu, Gangtao Xin +13Computer-Use Agent BenchmarksAI Agent Evaluation

  14. Can Agentic Trading Systems Pay for Their Own Intelligence?

    Jul 11, 2026Qiqi Duan, Changlun Li, Chen Wang +10LLM Agent EvaluationAgent Evaluation

  15. Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

    Jul 7, 2026Razvan Mihai PopescuSoftware Engineering AgentsLLM Agent Evaluation

  16. Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

    Jul 5, 2026Andrew Zhang, Chengzhan LiLLM Agent EvaluationAI Agent Evaluation

  17. LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

    Jul 1, 2026Ruotong Zhao, Zhiyu Chen, Xurui Liu +7Human Preference EvaluationLLM-as-a-Judge

  18. Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

    Jun 29, 2026Dvir Alsheich, Adar Peleg, Ben Hagag +3Adversarial Attacks on LLMsAgent Evaluation

  19. Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

    Jun 23, 2026Tian Zheng, Kai-Tai HsuLLM-as-a-JudgeHuman-in-the-Loop Evaluation

  20. LegalWorld: A Life-Cycle Interactive Environment for Legal Agents

    Jun 17, 2026Songhan Zuo, Shengbin Yue, Tao Chiang +4Agent EvaluationLLM Agents

  21. The Illusion of Multi-Agent Advantage

    Jun 11, 2026Prathyusha Jwalapuram, Hehai Lin, Chuyuan Li +7AI Agent EvaluationAgent Evaluation

  22. Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks

    Jun 10, 2026Mengyu Zheng, Kai Han, Boxun Li +13AI Coding AgentsSoftware Engineering Benchmarks

  23. MedCTA: A Benchmark for Clinical Tool Agents

    Jun 10, 2026Tajamul Ashraf, Hyewon Jeong, Fida Mohammad Thoker +1Agent EvaluationAI Agent Benchmarks

  24. DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

    Jun 10, 2026Raffi KhatchadourianAgent EvaluationAI Agent Benchmarks