AI Agent Evaluation

Momentum

58 papers in the last four weeks, up 100% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 341

All topics
CardsList
  1. Measuring Intelligence Beyond Human Scale

    Jul 8, 2026Jerry Han, Rafael Moschopoulos, Ella Colby +6LLM EvaluationAI Agent Evaluation

  2. A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

    Jul 7, 2026Nima Kelidari, Mohammadsaeed Haghi, Mahdi SalmaniReinforcement LearningGame-Playing Agents

  3. An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

    Jul 7, 2026Hao He, Xueying Liu, Chris J. Kuhlman +1AI Coding AgentsAI Agent Evaluation

  4. AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

    Jul 7, 2026Andrey Podivilov, Vadim Lomshakov, Sergey Savin +4Computer-Use Agent BenchmarksAI Coding Agents

  5. Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

    Jul 7, 2026Akshay Arora, Ishan Nigam, Ashutosh Aggarwal +6Agentic RLAI Agent Evaluation

  6. Collective Intelligence with Foundation Models

    Jul 6, 2026J. de Curtò, I. de ZarzàAI Agent EvaluationMulti-Agent Collaboration

  7. Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

    Jul 5, 2026Andrew Zhang, Chengzhan LiLLM Agent EvaluationAI Agent Evaluation

  8. Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

    Jul 5, 2026Guijia Zhang, Harry YangGUI AgentsAI Agent Evaluation

  9. Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

    Jul 3, 2026Yishu Wang, Yuxuan Wang, Jiaqi Deng +1AI Agent EvaluationPrediction Markets

  10. TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

    Jul 2, 2026Jiale Amber Wang, Kaiyuan Wang, Pengyu NieAutomated Software TestingBenchmark Design

  11. Accuracy and Cost Claims Do Not Survive Re-Execution in Agentic VideoQA

    Jul 1, 2026Rama AlHamidi, Aseel Mohamed, Rasul Khanbayov +3AI Agent EvaluationVideo QA

  12. Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

    Jul 1, 2026Zhi Chen, Zhensu Sun, Yuling Shi +2Benchmark AuditingBenchmark Design

  13. SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages

    Jun 27, 2026My Chiffon Nguyen, Aulia Adila, Saksorn Ruangtanusak +4LLM Agent EvaluationAI Agent Evaluation

  14. RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection

    Jun 25, 2026Xingyu Ren, Chugang Yi, Ge Ma +1Robot Policy LearningAI Agent Evaluation

  15. The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

    Jun 24, 2026Alex Iacob, Andrej Jovanović, William F. Shen +12Evolutionary OptimizationAI Agent Evaluation

  16. Probabilistic Agents in Deterministic Audits: Evaluating Multi-Agent Systems for Automated Audits Based on the German IT-Grundschutz

    Jun 24, 2026Lea Roxanne Muth, Marian MargrafMulti-Agent LLM SystemsAI Agent Evaluation

  17. Life After Benchmark Saturation: A Case Study of CORE-Bench

    Jun 23, 2026Nitya Nadgir, Sayash Kapoor, Kangheng Liu +11OOD GeneralizationAI Agent Evaluation

  18. Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty

    Jun 23, 2026Antonis Antoniades, Deepak Nathani, Ritam Saha +6Novelty SearchAI Agent Evaluation

  19. NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

    Jun 23, 2026Yuru Wang, Lejun Cheng, Yuxin Zuo +14AI for ScienceCoding Agents

  20. Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

    Jun 22, 2026Prajjwal Gupta, Prasang Gupta, Vishal Bhutani +4AI Agent EvaluationAI Agent Monitoring

  21. Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

    Jun 22, 2026Steven Young EuligAI Agent ReliabilityReasoning Evaluation

  22. When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

    Jun 22, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangAI Agent EvaluationIndirect Prompt Injection

  23. Autonomous Event-Driven Multi-Agent Orchestration for Enterprise AI at Scale

    Jun 18, 2026Harsh Rao Dhanyamraju, Leonidas Raghav, Aaron LeeMulti-Agent OrchestrationAI Agent Evaluation