LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

    May 18, 2026Leyao Wang, Yanan He, Peng Chen +5AI Agent ReliabilityLLM-as-a-Judge

  2. How Far Are We From True Auto-Research?

    May 18, 2026Zhengxin Zhang, Ning Wang, Sainyam Galhotra +1LLM Agent EvaluationAI Agent Benchmarks

  3. Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

    May 18, 2026Rishi Jha, Harold Triedman, Arkaprabha Bhattacharya +1Agent Failure AnalysisAI Agent Reliability

  4. POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

    May 18, 2026Qiaoyuan Zheng, Yiqu Yang, Qi Gao +1LLM Agent EvaluationLLM Agent Security

  5. SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

    May 18, 2026Yifan Zhou, Zhentao Zhang, Ziming Cheng +8LLM Agent EvaluationLLM Agent Skill Learning

  6. EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

    May 18, 2026Yuyao Wang, Zhongjian Zhang, Mo Chi +7LLM Agent MemoryLLM Agent Evaluation

  7. Same Signal, Different Semantics: A Cross-Framework Behavioral Analysis of Software Engineering Agents

    May 18, 2026Wei Ma, Zhi Chen, Jingxu Gu +3Software Engineering AgentsLLM Agent Evaluation

  8. Evaluating Cognitive Age Alignment in Interactive AI Agents

    May 18, 2026Yifan Shen, Jiawen Zhang, Jian Xu +4LLM Agent EvaluationAI Agent Benchmarks

  9. Interactive Evaluation Requires a Design Science

    May 18, 2026Keyang Xuan, Peiyang Song, Pan Lu +10LLM Agent EvaluationAI Agent Evaluation

  10. Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

    May 17, 2026Lecheng Yan, Ruizhe Li, Xicheng Han +5AI Agent ReliabilityLLM Agent Evaluation

  11. DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

    May 17, 2026Sirui Hong, Zhijie Liu, Tengfei Li +3Agent Failure AnalysisGUI Agents

  12. MetaCogAgent: A Metacognitive Multi-Agent LLM Framework with Self-Aware Task Delegation

    May 17, 2026Chenyu Wang, Yang ShuLLM Agent OrchestrationLLM Agent Evaluation

  13. ContractBench: Can LLM Agents Preserve Observation Contracts?

    May 17, 2026Jicheng Wang, Yifeng He, Zili Wang +3AI Agent ReliabilityLLM Agent Evaluation

  14. PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

    May 16, 2026Wenlong Shi, Jianxun Lian, Mingqi Wu +5Large Language Model-Based Role-Play SimulationPersonality Modeling in Language Models

  15. The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

    May 16, 2026Yuxuan Ye, Jun Han, Ao Hu +7LLM Agent EvaluationAI Agent Benchmarks

  16. Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

    May 16, 2026Xiaohua Wang, Chao Han, Kai Yu +2LLM Agent OrchestrationLLM Agent Evaluation

  17. PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

    May 15, 2026Yunan Lu, Luigi Liu, Omar Yahia +2AI Agent ReliabilityAdversarial Prompt Generation

  18. Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP

    May 15, 2026Igor Bogdanov, Chung-Horng Lung, Thomas Kunz +3Multi-Agent LLM SystemsLLM Agent Orchestration

  19. Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

    May 15, 2026Jinuk Kim, Junsoo Byun, Donghwi Hwang +2Electronic Design AutomationLLM Agent Evaluation

  20. Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

    May 14, 2026Sahil Sen, Akhil Kasturi, Elias Lumer +2Agentic SearchLLM Agent Evaluation

  21. TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

    May 14, 2026Pei Yang, Wanyi Chen, Tongyun Yang +15Benchmark DesignLLM Agent Evaluation