LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. What Do CAE Simulation Agents Really Need Beyond a Generic Harness?

    Sep 3, 2026Jiasheng Shi, Tianhan ZhangMulti-Agent LLM SystemsLLM Agent Evaluation

  2. KC-Bench: A Dynamic Interactive Benchmark for Evaluating Knowledge Conflicts in LLM Agents

    Sep 3, 2026Yaxing Lyu, Shengjie Zhou, Binbin Toh +2Knowledge Conflicts in Language ModelsLLM Agent Evaluation

  3. MasterControl Seventeen Every Time

    Sep 2, 2026MasterControl AI LabLLM Agent EvaluationText-to-SQL

  4. EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction

    Sep 2, 2026Yuling Shi, Zhensu Sun, Junsen Dong +3LLM Agent Evaluation

  5. CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI

    Sep 2, 2026Austin Tudor David Andrews, Liam Wilkinson, Jamie Heagerty +3LLM Agent EvaluationLLM Tool Use

  6. A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models

    Sep 2, 2026Yikai Zhao, Saurabh Pandey, Pradeep Kumar MisraMulti-Agent LLM SystemsClarification Question Generation

  7. Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation

    Sep 1, 2026Kefeng Duan, Dewu Zheng, Yanlin Wang +7Software Engineering BenchmarksLLM Agent Evaluation

  8. When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation

    Sep 1, 2026Peiying Zhu, Sidi ChangLLM GuardrailsLLM Agent Evaluation

  9. WorldBench: Culturally Grounded Benchmark for Multilingual Agents

    Sep 1, 2026Leonardo Ranaldi, Sherrie Shen, Jushi Kai +1Cross-Cultural Language Model EvaluationLLM Agent Evaluation

  10. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

    Sep 1, 2026Kangjia Zhao, Jiajun Li, Haozhan Shen +8Tool-Use EvaluationLLM Agent Evaluation

  11. Exploring Collaboration between a language and a non-language agent

    Aug 31, 2026Harini S, Somesh Singh, Yaman K Singla +3Multi-Agent LLM SystemsLLM Agent Evaluation

  12. RestoreBench: Can AI Agents Restore Power Flow Convergence?

    Aug 31, 2026Riccardo Mansutti, Andrea Pomarico, Robert Jakob +3Multi-Agent LLM SystemsLLM Agent Evaluation

  13. Toward Workflow-Aware Benchmarking for Healthcare NLP Agents

    Aug 31, 2026Junyi Yao, Baichuan Li, Zihao Zheng +1Benchmark DesignLLM Agent Evaluation

  14. Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

    Aug 31, 2026Le Chen, Zishen Wan, Baixi Sun +6Agent MemoryAI Coding Agents

  15. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

    Aug 31, 2026Wei Chen, Peilun Zhou, Zhaoyu Hu +8Tool-Use EvaluationLLM Agent Evaluation

  16. Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

    Aug 31, 2026Hanlin Tian, Minhao Li, Yu Mi +5LLM Agent EvaluationAI Agent Benchmarks

  17. Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators

    Aug 31, 2026Xinyue Zhao, Ruiyi Zhang, Liqin Ye +3Time Series ForecastingLLM Agent Evaluation

  18. Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks

    Aug 30, 2026Shitanshu Bhushan, Yunxiang Zhang, Lu WangCreativity AssessmentLLM Agent Evaluation

  19. Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

    Aug 25, 2026Anupam Purwar, Shashank Singh, Kritika SrivastavaVoice Agent EvaluationLLM-as-a-Judge

  20. K-Bench: measuring model performance on real scientific agent requests

    Aug 21, 2026Aubrey M. Brueckner, Darshil Patel, Yuhuan He +1AI for ScienceLLM Agent Evaluation

  21. Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

    Aug 21, 2026Emma Granqvist, Rocío Mercado, Samuel GenhedenAI Agents for Scientific DiscoveryLLM-as-a-Judge

  22. QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Aug 13, 2026Shangao Li, Yao Zhang, Volker Tresp +1LLM Agent EvaluationAgent Evaluation