LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Evaluating Agentic Configuration Repair for Computer Networks

    Jun 4, 2026Rufat Asadli, Benjamin Hoffman, Ioannis Protogeros +1LLM Agent EvaluationAI Agent Benchmarks

  2. Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows

    Jun 4, 2026Yuhang Fu, Ruishan Fang, Jiaqi Shao +4Multi-Agent LLM SystemsLLM Agent Evaluation

  3. Enhancing Software Engineering Through Closed-Loop Memory Optimization

    Jun 4, 2026Xuehang Guo, Zora Zhiruo Wang, Qingyun Wang +2Software Engineering AgentsLLM Agent Evaluation

  4. AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

    Jun 4, 2026Jiayu Liu, Cheng Qian, Zhenhailong Wang +10LLM PlanningLLM Agent Evaluation

  5. Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

    Jun 4, 2026Kaixuan Liu, Guojun Xiong, Weinan Zhang +1World Model LearningOff-Policy Evaluation

  6. AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

    Jun 4, 2026Yang Li, Jiaxiang Liu, Jiang Cai +1LLM Agent EvaluationIntent Classification

  7. ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?

    Jun 4, 2026Woojung Song, Nalim Kim, Sangjun Song +3Large Language Model-Based Role-Play SimulationPersonality Modeling in Language Models

  8. ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

    Jun 4, 2026Jintao Huang, Xiaomin Li, Gaurav Mittal +1AI Coding AgentsLLM Agent Evaluation

  9. Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

    Jun 3, 2026Cheng Liang, Pengcheng Qiu, Ya Zhang +3LLM Agent EvaluationAI Agent Benchmarks

  10. How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

    Jun 3, 2026Kokil Jaidka, Saifuddin AhmedLLM AuditingLLM Agent Evaluation

  11. Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

    Jun 3, 2026Haoyu Sun, Wenxuan Wang, Mingyang Song +5Tool-Augmented Language Model AgentsLLM Agent Evaluation

  12. Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation

    Jun 3, 2026Yongjie Wang, Xinyue Zhang, Kunhong Yao +4Deep Research AgentsLLM Agent Evaluation

  13. Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline

    Jun 3, 2026Zhikai Chen, Jialiang Gu, Junyu Yin +6Agent MemoryLLM Agent Memory

  14. SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

    Jun 2, 2026Joel Sol, Homayoun NajjaranMulti-Agent CoordinationLLM Agent Evaluation

  15. MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents

    Jun 2, 2026Jia Yu, Zilong Wang, Xinyang Jiang +2Computer-Use Agent BenchmarksComputer-Use Agents

  16. The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation

    Jun 2, 2026Herun Wan, Jiaying Wu, Minnan Luo +4Multi-Agent LLM SystemsLLM Agent Evaluation

  17. Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks

    Jun 1, 2026Dipesh KC, Anjila BudathokiCoding AgentsSoftware Engineering Benchmarks

  18. The Epi-LLM Framework: probing LLM behavioral priors through epidemiological agent-based models

    Jun 1, 2026Petra Ferencz, Ava Keeling, Tobias O'Keefe +4Human Behavior SimulationLLM Agent Evaluation

  19. ΨΨ-Bench: Evaluating Persona-Sensitive Influencing in Persuasive Dialogues

    Jun 1, 2026Peixuan Han, Hongyi Du, Jiayu Liu +3LLM PersonalizationLLM Agent Evaluation

  20. HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

    Jun 1, 2026Anshun Asher Zheng, Kanishka Misra, David I. Beaver +1LLM Agent EvaluationAI Agent Benchmarks

  21. MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

    Jun 1, 2026Wenhao Wang, Peizhi Niu, Gongyi Zou +9LLM Agent EvaluationAI Agent Benchmarks

  22. K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

    Jun 1, 2026Nahyun Lee, Dongkeun Yoon, Guijin Son +12Computer-Use Agent BenchmarksLLM Evaluation

  23. SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

    Jun 1, 2026Yuyan Bu, Haowei Li, Qirui Zheng +7LLM Agent EvaluationAI Agent Safety

  24. Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

    Jun 1, 2026Garvin Guo, Donglei Yu, Yu Chen +6Tool-Use EvaluationLLM Agent Evaluation

  25. POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

    Jun 1, 2026Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal +5Agent Failure AnalysisAI Agent Reliability