LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

    Jul 15, 2026Yongqiang Chen, Guangyi Chen, Yuewen Sun +1Analogical ReasoningLLM Agent Evaluation

  2. DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

    Jul 15, 2026Huatao Li, Xinwei Geng, Yuheng Wang +9Computer-Use Agent BenchmarksLLM Agent Evaluation

  3. Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

    Jul 15, 2026Teri Rumble, Javad Zarrin, P. George Lovell +1Retrieval-Augmented GenerationIntelligent Tutoring Systems

  4. Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

    Jul 14, 2026Junjie Yin, Xinyu FengSoftware Engineering AgentsLLM Agent Evaluation

  5. Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

    Jul 14, 2026Xing Zhang, Guanghui Wang, Yanwei Cui +4LLM Agent EvaluationLLM Agent Self-Improvement

  6. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

    Jul 14, 2026Yaopei Zeng, Congchao Wang, JianHang Chen +3AI Agent ReliabilityLLM Agent Evaluation

  7. PM-Bench: Evaluating Prospective Memory in LLM Agents

    Jul 14, 2026Genglin Liu, Saadia GabrielLLM Agent MemoryLLM Agent Evaluation

  8. Fin-Analyst at FinMMEval 2026 Task 3: A Live Hybrid Trading Agent with LLM Specialists and Rule-Based Signals

    Jul 14, 2026Mohotarema Rashid, Lingzi Hong, Junhua Ding +1Multi-Agent LLM SystemsLLM Agent Evaluation

  9. Rethinking the Evaluation of Harness Evolution for Agents

    Jul 14, 2026Yike Wang, Huaisheng Zhu, Zhengyu Hu +8LLM Agent EvaluationAgent Harness Optimization

  10. The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

    Jul 13, 2026Chenglin Yu, Hongquan Gui, Ying Yu +3LLM Agent EvaluationAI Agent Benchmarks

  11. AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

    Jul 13, 2026Aritra Mazumder, Nusrat jahan LiaAI Agent ReliabilityLLM Agent Evaluation

  12. How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

    Jul 12, 2026Yunbo Lyu, David Williams, Jieke Shi +5Software Engineering AgentsLLM Agent Evaluation

  13. Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

    Jul 12, 2026Yongchang Fu, Xinjie Huang, Chengjun Dai +3Large Language Model-Guided OptimizationLLM Agent Evaluation

  14. Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Self-Improving Personal Agents

    Jul 12, 2026Xutao Mao, Liangjie Zhao, Leyao Wang +6LLM SycophancyLLM Agent Memory

  15. Can Agentic Trading Systems Pay for Their Own Intelligence?

    Jul 11, 2026Qiqi Duan, Changlun Li, Chen Wang +10LLM Agent EvaluationAgent Evaluation

  16. AgentAbstain: Do LLM Agents Know When Not to Act?

    Jul 11, 2026Xun Liu, Yi Evie Zhang, Vira Kasprova +5AI Agent ReliabilityLLM Agent Evaluation

  17. Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?

    Jul 10, 2026Jiale Liu, Huajun Xi, Shaokun Zhang +6Agent Failure AnalysisLLM Agent Evaluation

  18. DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

    Jul 10, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +4Computer-Use Agent BenchmarksLLM Agent Evaluation

  19. Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics

    Jul 7, 2026Pavel Snopov, German MagaiMathematical Reasoning BenchmarksKnowledge Augmentation for Language Models

  20. Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

    Jul 7, 2026Razvan Mihai PopescuSoftware Engineering AgentsLLM Agent Evaluation