Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

    May 18, 2026Youngsun Lim, Cusuh Ham, Pin-Yu Chen +1Factual Consistency EvaluationAutomated Evaluation

  2. SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

    May 15, 2026Avijit Shil, Suman SamuiLLM EvaluationFactual Consistency Evaluation

  3. Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis

    May 14, 2026Mor Ventura, Roy Hirsch, Yonatan Bitton +2Image Editing EvaluationText-Guided Image Editing

  4. In-IDE Toolkit for Developers of AI-Based Features

    May 14, 2026Yaroslav Sokolov, Yury Khudyakov, Lenar Sharipov +3AI Agent MonitoringAutomated Evaluation

  5. Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

    May 14, 2026Assaf Gerner, Netta Madvil, Nadav Barak +11LLM EvaluationRAG Evaluation

  6. Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations

    May 13, 2026Kyo Gerrits, Rik van Noord, Ana Guerberof ArenasCreativity AssessmentLLM-as-a-Judge

  7. Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation

    May 13, 2026Abdelrahman Eldesokey, Merey Ramazanova, Ahmad Sait +4Human-in-the-Loop EvaluationAutomated Evaluation

  8. DiffScore: Text Evaluation Beyond Autoregressive Likelihood

    May 12, 2026Wen Lai, Yingli Shen, Dingnan Jin +4LLM EvaluationLanguage Model Generation Evaluation

  9. An Empirical Study of Automating Agent Evaluation

    May 12, 2026Kang Zhou, Sangmin Woo, Haibo Ding +15Agent EvaluationAI Agent Benchmarks

  10. VISOR: A Vision-Language Model-based Test Oracle for Testing Robots

    May 11, 2026Prasun Saurabh, Pablo Valle, Aitor Arrieta +2Uncertainty Estimation for VLA ModelsAutomated Software Testing

  11. Text-to-CAD Evaluation with CADTests

    May 8, 2026Dimitrios Mallis, Marco Wang, Ahmet Serdar Karadeniz +3Text-to-CAD GenerationAutomated Evaluation

  12. PolySQL: Scaling Text-to-SQL Evaluation Across SQL Dialects via Automated Backend Isomorphism

    May 8, 2026Yotam Perlitz, Elad Venezian, Corentin Royer +2Benchmark DesignText-to-SQL

  13. Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction

    May 8, 2026Adnan Labib, Qiao Wang, Yixuan Huang +1LLM EvaluationGrammatical Error Correction

  14. SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions

    May 8, 2026Tianyu Wang, Nianjun ZhouComputational Literary StudiesLLM Evaluation

  15. Beyond Single Ground Truth: Reference Monism as Epistemic Injustice in ASR Evaluation

    May 8, 2026Anna Seo Gyeong Choi, Maria Teleki, James Caverlee +3ASR EvaluationAutomatic Speech Recognition

  16. DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

    May 7, 2026Juntong Wang, Jiarui Wang, Huiyu Duan +3Learning to RankBenchmark Design

  17. DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

    May 6, 2026Bryan Li, William Walden, Yu Hou +6Language Model Generation EvaluationRAG Evaluation

  18. FlowEval: Reference-based Evaluation of Generated User Interfaces

    May 5, 2026Jason Wu, Priyan Vaithilingam, Eldon Schoop +2Web Application GenerationAutomated Evaluation

  19. A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  20. Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

    Apr 30, 2026Chenxin Li, Zhengyang Tang, Mingxin Huang +8LLM Agent EvaluationAI Agent Benchmarks

  21. Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR

    Apr 30, 2026Sidi Chang, Peiying Zhu, Yuxiao Chen +1LLM EvaluationRubric-Based Evaluation

  22. SciHorizon-DataEVA: An Agentic System for AI-Readiness Evaluation of Heterogeneous Scientific Data

    Apr 29, 2026Dianyu Liu, Chuan Qin, Xi Chen +6AI for ScienceAutomated Evaluation

  23. Training Computer Use Agents to Assess the Usability of Graphical User Interfaces

    Apr 28, 2026Alice Gao, Weixi Tong, Rishab Vempati +4Computer-Use AgentsGUI Agents

  24. LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2LLM EvaluationLLM Self-Refinement

  25. SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials

    Apr 28, 2026Zhaohui Li, Peng He, Zhiyuan Chen +4LLM EvaluationAI in Education

  26. The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

    Apr 28, 2026Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani +1LLM EvaluationLLM Information Extraction