Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

    Jun 21, 2026Dexu Yu, Youhua Li, Zhaoyang Guan +12AI Agent AuditingAutomated Evaluation

  2. MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

    Jun 21, 2026Yikun Fu, Bowen Fu, Zhenyu Wu +10Computer-Use Agent BenchmarksComputer-Use Agents

  3. Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

    Jun 20, 2026Nour Rabih, Chatrine Qwaider, Ted BriscoeLLM EvaluationControllable Text Generation

  4. LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

    Jun 19, 2026Younghan Park, Hoyeon Lee, Hawon Jeong +1Speech ProsodyAutomated Evaluation

  5. Blame is easier than praise: Measuring off-ball defensive performance in football

    Jun 18, 2026Jonas Bischofberger, Runqing Ma, Pascal Bauer +2Automated EvaluationFine-Grained Credit Assignment

  6. RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

    Jun 17, 2026Pushwitha Krishnappa, Amit Das, Vinija Jain +2Open-Ended GenerationLLM Evaluation

  7. A Clinician-Centered Pipeline for Annotation and Evaluation in Ultrasound AI Studies

    Jun 17, 2026Fangyijie Wang, Jianjun Yu, Wentao Shi +4Human-in-the-Loop AnnotationHuman-in-the-Loop Evaluation

  8. Mitigating Scoring Errors and Compensating for Nonverbal Subtests in Speech-Based Dementia Assessment

    Jun 17, 2026Franziska Braun, Christopher Witzl, Andreas Erzigkeit +4Speech-Based Dementia DetectionAutomated Evaluation

  9. UXBench: Measuring the Actionability of LLM-Generated UX Critiques

    Jun 15, 2026Wenjie Wang, Yue Huang, Zipeng Ling +11LLM-as-a-JudgeLLM Agent Evaluation

  10. RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation

    Jun 15, 2026Zahra Khotanlou, Hashir Ahmed, Chenghao Tan +2Benchmark DesignAutomated Evaluation

  11. AIChilles: Automatically Uncovering Hidden Weaknesses in AI-Evolved Systems

    Jun 14, 2026Yajie Zhou, Ao Li, Ashwin Silla +2Automated Software TestingDifferential Testing

  12. ReportQA: QA-Based Radiology Report Evaluation

    Jun 13, 2026Yiming Shi, Shaoshuai Yang, Xi Chen +10Radiology Report GenerationMedical VLMs

  13. A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets

    Jun 11, 2026Tejas Agrawal, Vu Le, Sumit Gulwani +1Next-Action PredictionAutomated Evaluation

  14. AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

    Jun 11, 2026Xiaoyuan Liu, Jianhong Tu, Yuqi Chen +26Software Engineering AgentsAI Agent Evaluation

  15. DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

    Jun 11, 2026Jingxuan Han, Wei Liu, Mingyang Zhu +8LLM Agent EvaluationWeb Search Agents

  16. Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

    Jun 10, 2026Paul He, Shiva Kasiviswanathan, Dominik JanzingLLM EvaluationMulti-Turn Dialogue Evaluation

  17. Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

    Jun 10, 2026Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff +4Creativity AssessmentLLM Evaluation

  18. Sensitivity Analysis of Generative Spatial Audio Metrics: A Study on Responsiveness, Smoothness, and Symmetry

    Jun 10, 2026Purnima Kamath, Adrian S. Roman, Koichi Saito +2Automated EvaluationSpatial Audio

  19. Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

    Jun 9, 2026João Maria Janeiro, Mathurin Videau, Andrea Caciolai +3LLM EvaluationMultiple-Choice Question Answering

  20. DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

    Jun 8, 2026Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang +1Text-to-Music GenerationMusic Generation Evaluation

  21. A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

    Jun 8, 2026Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini +1Audio-Language Model EvaluationSpeech Processing

  22. Reasoning without Gold Standards: A Proxy-Judge Theory of Autoformalization

    Jun 8, 2026Lei Xu, Xin Quan, André FreitasLLM Self-RefinementLLM-as-a-Judge

  23. Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings

    Jun 8, 2026Mina Remeli, Moritz HardtPairwise ComparisonLLM-as-a-Judge

  24. RadOT-Eval: Auditable Structured-Evidence Transport for Radiology Report Evaluation

    Jun 7, 2026Weixin Liu, Juming Xiong, Yang Li +5Radiology Report GenerationAutomated Evaluation

  25. SLMJury: Can Small Language Models Judge as Well as Large Ones?

    Jun 5, 2026Anish Laddha, Nitesh Pradhan, Gaurav SrivastavaLLM-as-a-JudgeLanguage Model Generation Evaluation

  26. A Framework for Evaluating and Benchmarking Concept Drift Detection Methods

    Jun 5, 2026Vitor Cerqueira, Heitor Murilo Gomes, Marco Heyden +2Concept DriftSynthetic Benchmark Generation

  27. Meaning in Order, Order in Meaning: Semantic R-precision for Keyphrase Evaluation

    Jun 5, 2026Shamira Venturini, Steffen KinkelAutomated EvaluationIR Evaluation

  28. RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports

    Jun 3, 2026Zhenhong Yang, Zhuoyun Liu, Jintao Fei +4Factual Consistency EvaluationAutomated Evaluation