LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs

    Aug 5, 2026Jiaming Cheng, Subhransu Das, Rajiv RamnathKV CachingLLM Agent Evaluation

  2. Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

    Aug 5, 2026Jinyi Han, Yuanjian Xu, Ying Liao +6LLM Agent EvaluationLLM Agent Skill Retrieval

  3. Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems

    Aug 4, 2026J. de Curtò, I. de ZarzàCyber-Physical SystemsLLM Planning

  4. ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

    Aug 4, 2026Tianyi Guan, Yiding Wang, Haotong Yang +5Continual Learning for LLM AgentsLLM Agent Evaluation

  5. GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks

    Aug 4, 2026Leijun Zhou, Zhihao Liu, Xiang Qu +9LLM Agent EvaluationAI Agent Benchmarks

  6. Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

    Aug 4, 2026Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo +13AI Agent ReliabilityMulti-Agent LLM Systems

  7. DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

    Aug 4, 2026Xuyang Liu, Yibin Han, Zhenwei Zhang +8Retrieval-Augmented GenerationLLM Agent Evaluation

  8. EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

    Aug 4, 2026Unggi Lee, Sookbun Lee, Yeil Jeong +3Intelligent Tutoring SystemsAI in Education

  9. Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

    Aug 4, 2026Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi +1Adversarial Attacks on LLMsLLM Agent Evaluation

  10. An Explainable LLM Agent Layer for Open-World Anomaly Detection in Oil Wells

    Aug 4, 2026Lucas Gouveia Omena Lopes, Thales Miranda de Almeida Vieira, Eduardo Toledo de Lima Junior +1Interpretable Anomaly DetectionLLM Agent Evaluation

  11. Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations

    Aug 3, 2026Yashwanth YSMulti-Agent LLM SystemsNormative Conformity in Language Models

  12. ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision

    Aug 3, 2026Wei-Jung Huang, Bonan ShenPairwise ComparisonLLM Agent Evaluation

  13. ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

    Aug 3, 2026Vernon Toh, Navonil Majumder, Zhengyuan Liu +2LLM Agent EvaluationAI Agent Benchmarks

  14. From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

    Aug 3, 2026Jiajia Song, Bobo Li, Haiwen Yi +6LLM PersonalizationLLM Agent Evaluation

  15. GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

    Aug 3, 2026Jiarui Tan, Zhongjian Zhang, YaBo Guo +5LLM Agent EvaluationAI Agent Benchmarks

  16. GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

    Aug 3, 2026Abhinav Pothuri, Zhe Jiang, Zelin Xu +1LLM Agent EvaluationAI Agent Benchmarks

  17. Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races

    Aug 2, 2026Phu Hoa Pham, Duy Minh Dao Sy, Trung Kiet Huynh +9LLM Agent EvaluationAI Agent Safety

  18. Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

    Aug 2, 2026Tezan Sahu, Aritra Das, Pankaj Mittal +1Benchmark ConstructionLLM Agent Evaluation

  19. Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

    Aug 1, 2026Xinshun Feng, Ziqi Miao, Lijun Li +1AI Agents for Scientific DiscoveryHallucination in Language Models

  20. Measuring Cross-Task Behavioral Consistency in Language Model Agents

    Jul 31, 2026Amritesh Banerjee, Pranil RaichuraAI Agent ReliabilitySoftware Engineering Agents

  21. AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

    Jul 31, 2026Dong Yan, Jian Liang, Dapeng Hu +4LLM Agent EvaluationAI Agent Benchmarks

  22. AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

    Jul 31, 2026Tianyu Huai, Tingshuo Fan, Xinchi Chen +5LLM Agent EvaluationAI Agent Benchmarks