LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

    Jun 16, 2026Congjie Zheng, Chuanyi Xue, Bin Liang +2LLM Agent EvaluationAI Agent Benchmarks

  2. Dissecting model behavior through agent trajectories

    Jun 16, 2026Gaurav Gupta, Vatshank Chaturvedi, Jun Huan +1Software Engineering AgentsLLM Agent Evaluation

  3. MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

    Jun 16, 2026Lubin Bai, Mengyu Cao, Sixue Wang +5LLM Agent EvaluationUser Preference Modeling

  4. Benchmarking LLM Agents on Meta-Analysis Articles from Nature Portfolio

    Jun 15, 2026Anzhe Xie, Weihang Su, Yujia Zhou +2AI-Assisted Scientific ResearchLLM Agent Evaluation

  5. How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

    Jun 15, 2026Yimeng Chen, Zhe Ren, Firas Laakom +3LLM Agent EvaluationAI Agent Security

  6. AgentFairBench: Do LLM Agents Discriminate When They Act?

    Jun 15, 2026Triveni Morla, Rohith Reddy Bellibaltu, Manpreet Singh +1Algorithmic FairnessLLM Agent Evaluation

  7. Can Agents Infer Environment from Interaction? Evidence from Agentic Automata Learning

    Jun 15, 2026Reef Menaged, Gili Lior, Shauli Ravfogel +2LLM Agent EvaluationActive Learning

  8. Can LLM Coding Agents Reason About Time Series?

    Jun 15, 2026Filip Rechtorík, Ondřej Dušek, Zdeněk KasnerTime Series ReasoningTime Series QA

  9. An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

    Jun 15, 2026Hankyul Baek, Jaewon Noh, Sang Seo +5Data LeakageLLM Agent Evaluation

  10. UXBench: Measuring the Actionability of LLM-Generated UX Critiques

    Jun 15, 2026Wenjie Wang, Yue Huang, Zipeng Ling +11LLM-as-a-JudgeLLM Agent Evaluation

  11. From Question Answering to Task Completion: A Survey on Agent System and Harness Design

    Jun 14, 2026Jianyuan Guo, Zhiwei Hao, Chengcheng Wang +14LLM Agent EvaluationLLM Agents

  12. ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

    Jun 13, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  13. Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

    Jun 13, 2026Shijun Wan, Xuehai Wu, Jiwen Zhang +2LLM Agent EvaluationAI Agent Benchmarks

  14. Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

    Jun 12, 2026Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz +4Web Agent BenchmarksLLM Agent Evaluation

  15. Communication Policy Evolution for Proactive LLM Agents

    Jun 12, 2026Xinbei Ma, Jiyang Qiu, Yao Yao +10LLM Agent EvaluationLLM Agent Self-Improvement

  16. Formalizing Numerical Analysis: An Agent Pipeline and Quality Audit Beyond Kernel Acceptance

    Jun 12, 2026Theodore Meek, Siyuan Ge, Di Qiu Xiang +2LLM Agent EvaluationAutoformalization

  17. Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

    Jun 12, 2026Brendan King, Jeffrey FlaniganCoding AgentsLLM Agent Evaluation

  18. SANA: What Matters for QA Agents over Massive Data Lakes?

    Jun 11, 2026Austin Senna Wijaya, Jiaxiang Liu, Haonan Wang +1LLM Agent EvaluationQuestion Answering

  19. SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support

    Jun 11, 2026Ahmed Qayyum, Madison Werner, Kathryn Youngblood +2AI-Assisted Decision MakingData Provenance

  20. When Plausible Is Not Realistic: Evaluating Human Mobility in LLM-Based Urban Simulation

    Jun 11, 2026Gustavo H. Santos, Aline Carneiro Viana, Thiago H. SilvaHuman Behavior SimulationLLM Agent Evaluation

  21. LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

    Jun 11, 2026Fabrizio Marozzo, Pietro LiòLLM SycophancyLLM Agent Evaluation

  22. TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

    Jun 11, 2026Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani +5AI Agents for Scientific DiscoveryScientific Reasoning

  23. DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

    Jun 11, 2026Jingxuan Han, Wei Liu, Mingyang Zhu +8LLM Agent EvaluationWeb Search Agents

  24. GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

    Jun 11, 2026Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces +2LLM Agent EvaluationGeospatial Reasoning