LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Loop-Back Authority in LLM Agent Teams: A Paired Experiment on Flat and Hierarchical Coordination

    Sep 13, 2026Burak Agachan, Max van Duijn, Amirhossein ZohrehvandMulti-Agent LLM SystemsMulti-Agent Coordination

  2. Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return

    Sep 13, 2026Arham Sethi, Arsen Kenzhebayev, Saanvi Paturi +3Tool-Augmented Language Model AgentsDeception in Language Models

  3. DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents

    Sep 13, 2026Zhichao Shi, Xuhui Jiang, Wenjie Zhang +5LLM Agent EvaluationAI Agent Evaluation

  4. Evaluating Scaffolding-Oriented Multi-Agent Large Language Model System for Clinical Interview Training

    Sep 12, 2026Luming Yang, Haoxian Liu, Siqing Li +4Educational TechnologyLLM Agent Evaluation

  5. BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure

    Sep 12, 2026Shenghan Zheng, Zonglin Di, Yimin Liu +19Reward HackingLLM Agent Evaluation

  6. K-Bench: A Benchmark for LLM Unlearning in Agentic Deployments

    Sep 11, 2026Guangsheng Yu, Yanna Jiang, Qin Wang +2LLM Agent EvaluationPrivacy Leakage in Language Models

  7. SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs

    Sep 11, 2026Jiacheng Sang, Mengyuan Li, Sanxing Chen +3Agentic SearchLLM Interpretability

  8. ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation

    Sep 11, 2026Zesheng Wei, Mengfan Li, Wenhao Liu +3Automated NegotiationLLM Agent Evaluation

  9. From Document Silos to Process Intelligence: A Multi-Layer Knowledge Graph for CMC Process Development

    Sep 10, 2026Reza Amirmoshiri, Faryad Sahneh, Yasser JangjouKG ConstructionLLM Agent Evaluation

  10. LexAgentHallu: A Hierarchical Benchmark for Profiling Hallucinations in Legal Agents

    Sep 9, 2026Yujin Zhou, Mingxuan Zheng, Chuxue Cao +4Hallucination in Language ModelsLLM Agent Evaluation

  11. The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution?

    Sep 8, 2026Boyang Wang, Yunhan Wang, Yalun WuLLM Agent EvaluationLLM Agent Reliability

  12. Agentic ML Exploration (A-MLE) for Ads Ranking

    Sep 8, 2026Erwin Gao, Vinodh Kumar Sunkara, Jingyi Guan +36Learning to RankLLM Agent Evaluation

  13. SchemeArena: Factorized Stress Testing of Scheming in LLM Agents

    Sep 8, 2026Jie Ruan, Inderjeet Nair, Amy Liu +3LLM Agent EvaluationAI Agent Monitoring

  14. VEX-Bench: Benchmarking LLM Agents for Assessing Exploitability of Software Supply Chain Vulnerabilities

    Sep 7, 2026Jiahao Shi, Edward Tsien, Yifeng Di +10LLM Agent EvaluationSoftware Security

  15. SkillAlign: Aligning Skill Interfaces for LLM-based Agents

    Sep 7, 2026Shuo Ren, Xiaomian Kang, Jiajun ZhangLLM Agent EvaluationLLM Agent Skill Learning

  16. ττ\tau^\tau-Bench: An Environment for End-To-End, Realistic Agent Construction

    Sep 7, 2026Quan Shi, Keshav Dhandhania, Karthik Narasimhan +1AI Coding AgentsLLM Agent Evaluation

  17. ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies

    Sep 7, 2026Xinran Zhang, Pengrui Lu, Lyumanshan Ye +1AI-Assisted Decision MakingLLM Agent Evaluation

  18. Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning

    Sep 5, 2026Zhongan Bi, Qiwen Wang, Jianrong Jiang +11LLM Agent EvaluationWeb Search Agents

  19. Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization

    Sep 4, 2026Sihan Ge, Yichen Lin, Chenyu Zhou +3Large Language Model-Guided OptimizationLLM Agent Evaluation

  20. SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents

    Sep 3, 2026Xin He, Yanlin Wang, Mingwei Liu +3Software Engineering AgentsAutomated Program Repair

  21. Speak for Me: Giving LLMs the Situational Awareness to Participate in a Meeting

    Sep 3, 2026Muneeb Khan, Frederic Kirstein, Terry Ruas +1LLM Agent EvaluationConversational Agents