LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents

    May 10, 2026Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen +2LLM Agent EvaluationAI Agent Benchmarks

  2. Causal state binding predicts action control in language agents

    May 10, 2026Xiao JiaLanguage Model-Based ControlLLM Agent Evaluation

  3. MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions

    May 10, 2026Yaoning Yu, Ye Yu, Haojing Luo +1Human Behavior SimulationLLM Agent Evaluation

  4. ProactBench: Beyond What The User Asked For

    May 9, 2026Sepehr Harfi, Ahmad Salimi, Dongming Shen +1LLM Agent EvaluationProactive Assistance

  5. NARRA-Gym for Evaluating Interactive Narrative Agents

    May 8, 2026Yue Huang, Yuchen Ma, Jiayi Ye +14Language Model Generation EvaluationInteractive Storytelling

  6. AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents

    May 8, 2026Zhengkang Guo, Yiyang Li, Lin Qiu +7LLM Agent EvaluationLong-Horizon Agent Evaluation

  7. DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

    May 8, 2026Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang +2LLM Agent EvaluationAI Agent Benchmarks

  8. Business Utility of Large Language Models as Exploratory Data Analysis Agents

    May 8, 2026Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski +5LLM Agent EvaluationAI Agent Benchmarks

  9. Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

    May 8, 2026Yuyang Wu, Yue Huang, Shuaike Shen +8AI Agents for Scientific DiscoveryLLM Agent Evaluation

  10. TeamBench: Evaluating Agent Coordination under Enforced Role Separation

    May 8, 2026Yubin Kim, Chanwoo Park, Taehan Kim +9Multi-Agent CoordinationLLM Agent Evaluation

  11. SmellBench: Evaluating LLM Agents on Architectural Code Smell Repair

    May 7, 2026Ion George Dinu, Marian Cristian Mihăescu, Traian RebedeaAutomated Program RepairLLM Agent Evaluation

  12. Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

    May 7, 2026Hailey Onweller, Elias Lumer, Austin Huber +3LLM EvaluationCitation Verification

  13. STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

    May 7, 2026Hanxiang Chao, Yihan Bai, Rui Sheng +2Agent MemoryLLM Agent Evaluation

  14. Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems

    May 7, 2026Donghao Huang, Joon Kiat Chua, Zhaoxia WangFinancial ServicesMulti-Agent LLM Systems

  15. Stop Comparing LLM Agents Without Disclosing the Harness

    May 7, 2026Yunbei Zhang, Janet Wang, Yingqiang Ge +3LLM Agent EvaluationLong-Horizon Agent Evaluation

  16. SODE: Analyzing Social Dynamics in LLM Agents

    May 6, 2026Inseo Jung, Yoonseok Oh, Kyungryul Back +2Multi-Agent LLM SystemsLLM Agent Evaluation

  17. SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment

    May 5, 2026Joseph Breda, Fadi Yousif, Beszel Hawkins +30HealthcareMedical Diagnosis

  18. Evaluating Generative Models as Interactive Emergent Representations of Human-Like Collaborative Behavior

    May 5, 2026Shinas Shaji, Teena Chakkalayil Hassan, Sebastian Houben +1Multi-Agent LLM SystemsTheory of Mind

  19. SOTOPIA-TOM: Evaluating Privacy and Information Management in Multi-Agent Interaction with Theory of Mind

    May 4, 2026Yashwanth YS, Ruichen Wang, Shihua Zeng +4Multi-Agent CoordinationTheory of Mind