Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. Abstractiveness Metrics for Evaluating Text Summarization: A Refined Formulation with Empirical Validation

    Jul 12, 2026Praveenkumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad VittalaText SummarizationSummarization Evaluation

  2. Knowledge Distillation for Automated AI Tutor Evaluation

    Jul 12, 2026Tahmid Al Hannan, Diego Garcia, Alex Njoroge +2LLM-as-a-JudgeAI in Education

  3. CAFE: A Compound-AI Factorial Evaluation Framework

    Jul 11, 2026Fabian Lukassen, Christoph Weisser, Thomas Kneib +1RAG EvaluationAutomated Evaluation

  4. KGCQual: An Interpretable Framework for Evaluating the Knowledge Graph Construction Quality from Text

    Jul 11, 2026Nipun Misra, Vikranth Udandarao, Aanchal Gupta +3KG ConstructionAutomated Evaluation

  5. False Confidence: Automated Labels Confound Fairness Audits in Cervical Spine Segmentation

    Jul 8, 2026Linus Juni, Aasa Feragen, Aditya ParikhAlgorithmic FairnessMedical Image Segmentation

  6. Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

    Jul 7, 2026Niels Potters, Theo HofmanLLM EvaluationLLM Auditing

  7. FormalRx: Rectify and eXamine Semantic Failures in Autoformalization

    Jul 6, 2026Haocheng Wang, Baiyu Huang, Yingjia Wan +4Automated EvaluationAutoformalization

  8. Prompt-to-Paper: Agentic AI System for Bioinformatics

    Jul 5, 2026Ramsha Kamran, Maheera Amjad, Zartasha Mustansar +3Long-Form Document GenerationAI-Assisted Scientific Research

  9. Flow-A11y: Flow-Aware Accessibility Testing

    Jul 3, 2026Nasr Eddine Fliti, Leisan Kokorina, Florian Tambon +1Automated Software TestingAutomated Evaluation

  10. Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

    Jul 2, 2026Jan DrchalLLM EvaluationLanguage Model Generation Evaluation

  11. TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue

    Jul 1, 2026Hao Zhang, Thomas Thebaud, Georgi Tinchev +2Automated EvaluationFull-Duplex Spoken Dialogue Systems

  12. PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

    Jun 30, 2026Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar +6Computer-Use AgentsRubric-Based Evaluation

  13. SABER-Math: Automated Benchmark for Information Retrieval Evaluation in Mathematics

    Jun 29, 2026Nikolay Georgiev, Maria Drencheva, Kseniia Ibragimova +3Text Embedding EvaluationLLM Reranking

  14. Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

    Jun 28, 2026Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella BidermanBenchmark DesignBenchmark Validity

  15. BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

    Jun 27, 2026Oliver Cory, Maksym Ivashechkin, Karahan Sahin +6Sign Language TranslationAutomated Evaluation

  16. PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

    Jun 26, 2026Yana Wei, Hongbo Peng, Yanlin Lai +14Rubric-Based EvaluationAutomated Evaluation

  17. The Signal-Coverage Matrix: Stratifying Type and Semantic Errors in Statement Autoformalization

    Jun 26, 2026Chengxiao Dai, Zhaokun Yan, Zhanhui LinLLM Self-CorrectionLean Theorem Proving

  18. Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

    Jun 25, 2026Sangwoo Cho, Kushal Chawla, Pengshan Cai +4LLM EvaluationLLM-as-a-Judge

  19. Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

    Jun 25, 2026Manar Alsaid, Chimdumebi Nebolisa, Faris AbbasLLM EvaluationAutomated Program Repair

  20. Theory-Scale Auto-Formalization of Logics for Computer Science

    Jun 25, 2026Yuming Feng, Frederick Pu, One An +5Automated Theorem ProvingLean Theorem Proving

  21. Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data

    Jun 24, 2026Kylie AnglinLLM EvaluationConfidence Region Estimation

  22. Automated Residual Plot Assessment With the R Package autovi and the Shiny Application autovi.web

    Jun 23, 2026Weihao Li, Dianne Cook, Emi Tanaka +2Automated Evaluation

  23. Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

    Jun 22, 2026Prajjwal Gupta, Prasang Gupta, Vishal Bhutani +4AI Agent EvaluationAI Agent Monitoring

  24. Expert Consensus on Criteria for the Automated Assessment of Laparoscopic Camera Navigation

    Jun 22, 2026Amir Ebrahimzadeh, Nazila Esmaeili, Michael Ghadimi +1Surgical Video UnderstandingAutomated Evaluation