Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2Language Model Generation EvaluationFactual Consistency Evaluation

  2. STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

    Apr 27, 2026Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa +2LLM EvaluationSynthetic Data Generation

  3. Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

    Apr 27, 2026Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar +1LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  4. RAS: a Reliability Oriented Metric for Automatic Speech Recognition

    Apr 27, 2026Wenbin Huang, Yuhang Qiu, Bohan Li +5ASR EvaluationSelective Prediction

  5. MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

    Apr 26, 2026Haoxuan Zhang, Ruochi Li, Yang Zhang +4Automated EvaluationGenerative AI Evaluation

  6. Your Students Don't Use LLMs Like You Wish They Did

    Apr 26, 2026Sebastian Kobler, Matthew Clemson, Angela Sun +1Educational AssessmentAI in Education

  7. GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs

    Apr 25, 2026Federico A. KamelharAI Agent ReliabilityMulti-Agent LLM Systems

  8. Quantifying and Mitigating Self-Preference Bias of LLM Judges

    Apr 24, 2026Jinming Yang, Zheng Hu, Chuxian Qiu +3LLM-as-a-JudgeLanguage Model Bias Evaluation

  9. LAF-Based Evaluation and UTTL-Based Learning Strategies with MIATTs

    Apr 22, 2026Yongquan YangWeakly Supervised LearningAutomated Evaluation

  10. Centering Ecological Goals in Automated Identification of Individual Animals

    Apr 22, 2026Lukas Picek, Timm Haucke, Lukáš Adam +16Biometric IdentificationAnimal Re-Identification

  11. Embedding-Based Intrusive Evaluation Metrics for Musical Source Separation Using MERT Representations

    Apr 22, 2026Paul A. Bereuter, Alois SontacchiMusic Information RetrievalAutomated Evaluation

  12. Towards a Linguistic Evaluation of Narratives: A Quantitative Stylistic Framework

    Apr 21, 2026Alessandro MaistoStylometryAutomated Evaluation

  13. SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

    Apr 21, 2026Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu KaoLearning to RankText Summarization

  14. TactileEval: A Step Towards Automated Fine-Grained Evaluation and Editing of Tactile Graphics

    Apr 20, 2026Adnan Khan, Abbas Akkasi, Majid KomeiliRubric-Based EvaluationAutomated Evaluation

  15. ClawEnvKit: Automatic Environment Generation for Claw-Like Agents

    Apr 20, 2026Xirui Li, Ming Li, Ion Stoica +2Agent EvaluationAI Agent Benchmarks

  16. FSEVAL: Feature Selection Evaluation Toolbox and Dashboard

    Apr 20, 2026Muhammad Rajabinasab, Arthur ZimekFeature SelectionAutomated Evaluation

  17. Who Watches the Watchmen? Humans Disagree With Translation Metrics on Unseen Domains

    Apr 19, 2026Finn Schmidt, Jan Philip Wahle, Terry Ruas +1Annotator DisagreementAutomated Evaluation

  18. AI-Assisted Requirements Engineering: An Empirical Evaluation Relative to Expert Judgment

    Apr 16, 2026Oz Levy, Ilya Dikman, Natan Levy +1Requirements EngineeringHuman-in-the-Loop Evaluation

  19. Learning in Blocks: A Multi Agent Debate Assisted Personalized Adaptive Learning Framework for Language Learning

    Mar 29, 2026Nicy Scaria, Silvester John Joseph Kennedy, Deepak SubramaniMulti-Agent DebateAutomated Evaluation

  20. ECoLAD: Selecting Anomaly Detectors for Automotive Deployment via Compute-Reduction Evaluation

    Mar 11, 2026Kadir-Kaan Özer, René Ebeling, Markus EnzweilerEfficient Neural Network InferenceAutomated Evaluation

  21. Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization

    Mar 9, 2026Hongli Zhou, Hui Huang, Rui Zhang +5LLM-as-a-JudgeSocial Bias in Language Models

  22. Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

    Feb 27, 2026Xiang Li, Jiabao Gao, Sipei Lin +5Voice Agent EvaluationSpoken Dialogue Systems