LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Do LLMs Take Care of Their Own? Similarity Signals Can Induce Cooperation

    Aug 12, 2026Akash Kundu, Emanuel Tewolde, Ratip Emin Berker +2Multi-Agent LLM SystemsLLM Agent Evaluation

  2. Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

    Aug 12, 2026Gen Dong, Yanjie Gao, Liqun Li +3LLM Agent EvaluationLLM Agent Reliability

  3. Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

    Aug 12, 2026Zining Huang, Haoran Que, Hong Zeng +8AI Coding AgentsLLM Agent Evaluation

  4. Benchmarking LLM Judges for Mobile Agent Evaluation

    Aug 11, 2026Ziqiang Wan, Li Gu, Zhixiang Chi +4LLM-as-a-JudgeLLM Agent Evaluation

  5. Evaluating Rational Contracting in Natural Language

    Aug 11, 2026Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann +1Multi-Agent NegotiationAutomated Negotiation

  6. Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents

    Aug 10, 2026Neel Tushar Shah, Manglam Kartik, Akshat KarkarLLM Agent EvaluationLanguage Model Robustness

  7. The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

    Aug 9, 2026Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo +1AI Coding AgentsLLM Agent Evaluation

  8. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

    Aug 9, 2026Yijun Pan, Yukun Lian, Kunyu Shi +5LLM Agent EvaluationAI Agent Benchmarks

  9. A2EA^2E : An End-to-End Agent Auditing Engine

    Aug 7, 2026Haoning Wang, Mingxun Zhang, Chenyue Yu +4Tool-Use EvaluationAI Agent Auditing

  10. Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

    Aug 7, 2026Massimiliano Luca, Apoorva Singh, Bruno LepriMulti-Agent NegotiationAutomated Negotiation

  11. SkillEval: Decomposing Agent Skill Quality into Interpretable Signals

    Aug 7, 2026Jiahui Han, Qinuo Li, Ziheng Peng +6LLM Agent EvaluationAutomated Evaluation

  12. WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance

    Aug 7, 2026Zhi Li, Tao Zhou, Yeqing Li +2LLM Agent EvaluationTool-Using Agents

  13. Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events

    Aug 6, 2026Ming Wang, Peidong Wang, Xiaocui Yang +4Personality Modeling in Language ModelsLLM Agent Evaluation

  14. OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

    Aug 6, 2026Xinying Cai, Minghao Guo, Jiahe Liu +7LLM AuditingLLM Agent Evaluation

  15. FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

    Aug 6, 2026Aman Dalmia, Sanskriti Midha, Jigar DoshiVoice Agent EvaluationHealthcare

  16. When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

    Aug 6, 2026Weihong Lin, Lin Sun, Xiangzheng ZhangLLM Agent EvaluationTool-Using Agents

  17. Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

    Aug 5, 2026Nathan S Johnson, Ian AbshireAI Agents for Scientific DiscoveryLLM Agent Orchestration