Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

    Feb 13, 2026Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi +2VLM EvaluationCode Generation

  2. CLASE: A Hybrid Method for Chinese Legalese Stylistic Evaluation

    Feb 13, 2026Yiran Rex Ma, Yuxiao Ye, Huiyuan XieAutomated EvaluationLegal NLP

  3. ReportLogic: Evaluating Logical Quality in Deep Research Reports

    Jan 27, 2026Jujia Zhao, Zhaoxin Huan, Zihan Wang +4LLM-as-a-JudgeAutomated Evaluation

  4. CoReflect: A Reflective Co-Evolution Framework for Improving Conversational Evaluation

    Jan 18, 2026Yunzhe Li, Richie Yueqi Feng, Tianxin Wei +1Rubric-Based EvaluationAutomated Evaluation

  5. DR-Arena: an Automated Evaluation Framework for Deep Research Agents

    Jan 15, 2026Yiwen Gao, Ruochen Zhao, Yang Deng +1Deep Research AgentsBenchmark Design

  6. ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

    Nov 28, 2025Šimon Sedláček, Sara Barahona, Bolaji Yusuf +9Audio-Language Model EvaluationLLM Evaluation

  7. Evaluating Style-Personalized Text Generation: Challenges and Directions

    Aug 8, 2025Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  8. Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

    Aug 7, 2025Zachary Robertson, Sanmi KoyejoAdversarial RobustnessReference-Free Evaluation

  9. Honest and Reliable Evaluation and Expert Equivalence Testing of Automated Neonatal Seizure Detection

    Aug 6, 2025Jovana Kljajic, John M. O'Toole, Robert Hogan +1Inter-Rater ReliabilityAutomated Evaluation

  10. The NTNU System at the S&I Challenge 2025 SLA Open Track

    Jun 5, 2025Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang +4Audio-Language ModelsAutomated Evaluation

  11. Multimodal Language Models as Text-to-Image Model Evaluators

    May 1, 2025Jiahui Chen, Candace Ross, Reyhane Askari-Hemmat +5LLM-as-a-JudgeBenchmark Design

  12. SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

    Apr 10, 2025Sher Badshah, Ali Emami, Hassan SajjadLLM EvaluationLanguage Model Generation Evaluation

  13. Evaluating the Evaluator: Summarization Metrics and LLM-Judges beyond English

    Mar 21, 2025Jeremy Barnes, Naiara Perez, Alba Bonet-Jover +1Summarization EvaluationAutomated Evaluation

  14. A Course Intelligence Platform for Higher Education: Lessons from AI-Assisted Course Evaluation

    Nov 3, 2024Bo Yuan, Jiazi Hu, Haimei ZhaoEducational AssessmentGenerative AI in Education

  15. GPTBIAS: A Comprehensive Framework for Evaluating Bias in Large Language Models

    Dec 11, 2023Jiaxu Zhao, Meng Fang, Shirui Pan +2Language Model Bias EvaluationAutomated Evaluation

  16. DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Reports

    Date pendingRuizhe Li, Mingxuan Du, Benfeng Xu +3Deep Research AgentsLLM Agent Evaluation

  17. GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

    Date pendingAleksandr Tsymbalov, Danis Zaripov, Artem Epifanov +1LLM Agent EvaluationAI Agent Benchmarks