LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

    Feb 22, 2026Qijie You, Wenkai Yu, Wentao ZhangMulti-Hop QALLM Agent Evaluation

  2. Evaluating Test-Time Scaling of General LLM Agents

    Feb 22, 2026Xiaochuan Li, Ryan Ming, Pranav Setlur +6LLM Agent EvaluationTest-Time Scaling

  3. Evaluating Collective Behaviour of Hundreds of LLM Agents

    Feb 18, 2026Richard Willis, Jianing Zhao, Yali Du +1Social DilemmasMulti-Agent LLM Systems

  4. Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

    Feb 12, 2026Thibaud Gloaguen, Niels Mündler-Sasahara, Mark Niklas Müller +2AI Coding AgentsCoding Agents

  5. ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

    Feb 11, 2026Bang Nguyen, Dominik Soós, Qian Ma +8LLM Agent EvaluationAI Agent Benchmarks

  6. Evaluating Memory Structure in LLM Agents

    Feb 11, 2026Alina Shutova, Alexandra Olenina, Ivan Vinogradov +1LLM Agent MemoryLLM Agent Evaluation

  7. Do Web Agents Investigate Before They Decide?

    Feb 5, 2026Syed Nazmus Sakib, Nafiul Haque, Tapodhir Karmakar Taton +2Web Agent BenchmarksHallucination in Language Models

  8. MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

    Feb 3, 2026Vishal Venkataramani, Haizhou Shi, Zixuan Ke +6Multi-Agent LLM SystemsLLM-as-a-Judge

  9. AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

    Feb 2, 2026Shraddha Barke, Arnav Goyal, Alind Khare +3Agent Failure AnalysisAI Agent Reliability

  10. Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

    Jan 30, 2026Yuhao Zhan, Tianyu Fan, Linxuan Huang +2Deep Research AgentsHallucination Detection

  11. DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

    Jan 20, 2026Maojun Sun, Yifei Xie, Yue Wu +5LLM Agent EvaluationAgent Evaluation

  12. Real-Time Deadlines Reveal Fragile Temporal Adaptation in LLM Strategic Dialogues

    Jan 19, 2026Neil K. R. Sehgal, Sharath Chandra Guntuku, Lyle UngarLLM Agent EvaluationLLM Decision-Making

  13. AstroAgentBench: Evaluating Agentic Planning on Space Mission Planning Tasks

    Jan 16, 2026Weiyi Wang, Xinchi Chen, Jingjing Gong +2LLM Agent EvaluationAI Agent Benchmarks

  14. IDRBench: Benchmarking the Interactive Capabilities of Deep Research Agents

    Jan 10, 2026Yingchaojie Feng, Qiang Huang, Xiaoya Xie +4Deep Research AgentsLLM Agent Evaluation

  15. DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation

    Dec 19, 2025Janghoon Han, Heegyu Kim, Changho Lee +6Deep Research AgentsLLM Agent Evaluation

  16. AGAPI-Agents: An Open-Access Agentic AI Platform for Accelerated Materials Design on AtomGPT.org

    Dec 12, 2025Jaehyung Lee, Justin Ely, Kent Zhang +3AI Agents for Scientific DiscoveryLLM Agent Evaluation

  17. PPTArena: A Benchmark for PowerPoint Editing

    Dec 2, 2025Michael Ofengenden, Yunze Man, Ziqi Pang +2LLM Agent EvaluationAI Agent Benchmarks

  18. CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

    Nov 4, 2025Jiayu Liu, Cheng Qian, Zhaochen Su +4LLM PlanningLLM Agent Evaluation

  19. Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

    Oct 18, 2025Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen +1LLM Agent EvaluationTool-Using Agents

  20. BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software

    Sep 27, 2025Zehua Zhang, Ati Priya Bajaj, Divij Handa +14Software Engineering AgentsSoftware Engineering Benchmarks

  21. HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants

    Sep 10, 2025Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes +1LLM Agent EvaluationHuman-AI Interaction