LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

    Jul 7, 2025Yuanzhe Hu, Yu Wang, Julian McAuleyLLM Agent MemoryLLM Agent Evaluation

  2. SheetMind: Actions Set Accuracy, Agents Set the Failure Mode

    Jun 14, 2025Lyuhao Chen, Xi Cheng, Yanming Kang +11Multi-Agent LLM SystemsLLM Agent Evaluation

  3. AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

    Jun 4, 2025Akshat Naik, Emma Gouné, Patrick Quinn +4AI AlignmentLLM Agent Evaluation

  4. Towards LLM Agents for Earth Observation

    Apr 16, 2025Chia Hsiang Kao, Wenting Zhao, Cheryl Lam +10Code GenerationLLM Agent Evaluation

  5. How Well Can Modern LLMs Act as Agent Cores in Radiology Environments?

    Dec 12, 2024Qiaoyu Zheng, Chaoyi Wu, Weike Zhao +5HealthcareLLM Agent Evaluation

  6. DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Reports

    Date pendingRuizhe Li, Mingxuan Du, Benfeng Xu +3Deep Research AgentsLLM Agent Evaluation

  7. WorkflowPerturb: Calibrated Stress Tests for Evaluating Multi-Agent Workflow Metrics

    Date pendingMadhav Kanda, Sharad Agarwal, Rodrigo Fonseca +2LLM Agent EvaluationAI Agent Benchmarks

  8. GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

    Date pendingAleksandr Tsymbalov, Danis Zaripov, Artem Epifanov +1LLM Agent EvaluationAI Agent Benchmarks

  9. OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

    Date pendingKaicheng Zhang, Wen Ge, Lei Jiang +5Quantitative FinanceLLM Agent Evaluation

  10. Your Agent Says Yes: Interpreting Adversarial Market Behavior Beyond Individual Transactions

    Date pendingZelin Li, Yiyun Su, Matt White +3LLM Agent EvaluationAI Agent Security