LLM Agent Evaluation

LLM: Large Language Model

Momentum

109 papers in the last four weeks, up 88% on the four weeks before. 1.3% of all new papers.

Jul 6Week of Sep 21

Latest papers 793

All topics
CardsList
  1. ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

    Jun 16, 2026Shanda Li, Qiuhong Anna Wei, Jingwu Tang +5LLM Agent EvaluationAI Agent Benchmarks

  2. A Framework for Evaluating Agentic Skills at Scale

    Jun 16, 2026Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich +3LLM Agent EvaluationInstruction Following

  3. SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

    Jun 16, 2026Congjie Zheng, Chuanyi Xue, Bin Liang +2LLM Agent EvaluationAI Agent Benchmarks

  4. Dissecting model behavior through agent trajectories

    Jun 16, 2026Gaurav Gupta, Vatshank Chaturvedi, Jun Huan +1Software Engineering AgentsLLM Agent Evaluation

  5. MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

    Jun 16, 2026Lubin Bai, Mengyu Cao, Sixue Wang +5LLM Agent EvaluationUser Preference Modeling

  6. Benchmarking LLM Agents on Meta-Analysis Articles from Nature Portfolio

    Jun 15, 2026Anzhe Xie, Weihang Su, Yujia Zhou +2AI-Assisted Scientific ResearchLLM Agent Evaluation

  7. How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

    Jun 15, 2026Yimeng Chen, Zhe Ren, Firas Laakom +3LLM Agent EvaluationAI Agent Security

  8. AgentFairBench: Do LLM Agents Discriminate When They Act?

    Jun 15, 2026Triveni Morla, Rohith Reddy Bellibaltu, Manpreet Singh +1Algorithmic FairnessLLM Agent Evaluation

  9. Can Agents Infer Environment from Interaction? Evidence from Agentic Automata Learning

    Jun 15, 2026Reef Menaged, Gili Lior, Shauli Ravfogel +2LLM Agent EvaluationActive Learning

  10. Can LLM Coding Agents Reason About Time Series?

    Jun 15, 2026Filip Rechtorík, Ondřej Dušek, Zdeněk KasnerTime Series ReasoningTime Series QA

  11. An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

    Jun 15, 2026Hankyul Baek, Jaewon Noh, Sang Seo +5Data LeakageLLM Agent Evaluation

  12. UXBench: Measuring the Actionability of LLM-Generated UX Critiques

    Jun 15, 2026Wenjie Wang, Yue Huang, Zipeng Ling +11LLM-as-a-JudgeLLM Agent Evaluation

  13. From Question Answering to Task Completion: A Survey on Agent System and Harness Design

    Jun 14, 2026Jianyuan Guo, Zhiwei Hao, Chengcheng Wang +14LLM Agent EvaluationLLM Agents

  14. ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

    Jun 13, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  15. Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

    Jun 13, 2026Shijun Wan, Xuehai Wu, Jiwen Zhang +2LLM Agent EvaluationAI Agent Benchmarks

  16. Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

    Jun 12, 2026Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz +4Web Agent BenchmarksLLM Agent Evaluation

  17. Communication Policy Evolution for Proactive LLM Agents

    Jun 12, 2026Xinbei Ma, Jiyang Qiu, Yao Yao +10LLM Agent EvaluationLLM Agent Self-Improvement

  18. Formalizing Numerical Analysis: An Agent Pipeline and Quality Audit Beyond Kernel Acceptance

    Jun 12, 2026Theodore Meek, Siyuan Ge, Di Qiu Xiang +2LLM Agent EvaluationAutoformalization

  19. Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

    Jun 12, 2026Brendan King, Jeffrey FlaniganCoding AgentsLLM Agent Evaluation

  20. SANA: What Matters for QA Agents over Massive Data Lakes?

    Jun 11, 2026Austin Senna Wijaya, Jiaxiang Liu, Haonan Wang +1LLM Agent EvaluationQuestion Answering

  21. SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support

    Jun 11, 2026Ahmed Qayyum, Madison Werner, Kathryn Youngblood +2AI-Assisted Decision MakingData Provenance

  22. When Plausible Is Not Realistic: Evaluating Human Mobility in LLM-Based Urban Simulation

    Jun 11, 2026Gustavo H. Santos, Aline Carneiro Viana, Thiago H. SilvaHuman Behavior SimulationLLM Agent Evaluation

  23. LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

    Jun 11, 2026Fabrizio Marozzo, Pietro LiòLLM SycophancyLLM Agent Evaluation

  24. TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

    Jun 11, 2026Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani +5AI Agents for Scientific DiscoveryScientific Reasoning