LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Know It, Act on It: Investigating Memory Utilization in LLM Personalization

    Jul 31, 2026Zhaoxin Feng, Jianfei Ma, Emmanuele ChersoniLLM PersonalizationLLM Agent Memory

  2. MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

    Jul 31, 2026Jianxin Gao, Beini Hu, Runze Li +6Game-Playing AgentsLLM Agent Evaluation

  3. MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

    Jul 31, 2026Qiming Shi, Yulong Tao, Linbo Jin +10LLM Agent EvaluationLong-Horizon Agent Evaluation

  4. Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

    Jul 30, 2026Xiaonan Xu, Wenjing WuAutomated Software TestingAutomated Program Repair

  5. Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

    Jul 30, 2026Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa +3Multi-Agent LLM SystemsSocial Deduction Games

  6. DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

    Jul 30, 2026Debin Meng, Jiaming Yang, Zefang Zong +4LLM Agent EvaluationAutomated Evaluation

  7. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Jul 30, 2026Yuhang Zhu, Mingxuan Du, Benfeng Xu +3LLM EvaluationLarge Language Model-Based Role-Play Simulation

  8. Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

    Jul 30, 2026Phuc Pham, Truong-Son HyAI Agents for Scientific DiscoveryData Provenance

  9. Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

    Jul 29, 2026Jinwei Hu, Yi Qi, Xinmiao Huang +3LLM Agent EvaluationAI Agent Benchmarks

  10. VAmoS Bench: Voice Agent Simulation Bench

    Jul 29, 2026Joshua Meyer, Sahar Shayegan, Ritiz Tambi +5Voice Agent EvaluationCustomer Support Automation

  11. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

    Jul 29, 2026Jingbo Zhou, Yusai Zhao, Qi Bao +12Computer-Use Agent BenchmarksComputer-Use Agents

  12. TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

    Jul 29, 2026Jinhu Qi, Wentao Zhang, Siu Man Ng +4Tool-Use EvaluationLLM Agent Evaluation

  13. SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

    Jul 29, 2026Lehan Wang, Boli Chen, Ruixue Ding +7LLM Agent EvaluationCybersecurity

  14. RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

    Jul 28, 2026Fanqing Meng, Lingxiao Du, Qiguang Chen +4LLM Agent EvaluationLLM Agent Self-Improvement

  15. Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt Collection

    Jul 28, 2026Yuhang Yang, Kai Tang, Chao Ye +4Automated NegotiationLLM Agent Evaluation

  16. CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

    Jul 27, 2026Dengzhe Hou, Lingyu Jiang, Fangzhou Lin +1ElectroencephalographySelective Inference

  17. Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis

    Jul 26, 2026Xinhao Yao, Yuanzhuo Liu, Changhao Wang +6Deep Research AgentsLLM Agent Evaluation

  18. AI Assistants Overassist

    Jul 23, 2026Verona Teo, Raghav Jain, Tobias Gerstenberg +1Intelligent Tutoring SystemsLLM Agent Evaluation

  19. Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

    Jul 23, 2026Pengyu Zhu, Lijun Li, Longju Yang +2Deep Research AgentsRAG Poisoning Attacks