Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. A Common Measure of Communication for Speech Brain-Computer Interfaces

    Sep 2, 2026Dulhan Jayalath, Benjamin Ballyk, Oiwi Parker JonesBrain-Computer InterfacesAutomated Evaluation

  2. PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

    Sep 2, 2026Fan Yuxuan, Huang Miaojun, Zhang Haimei +2Automated EvaluationRubric-Based Evaluation

  3. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4LLM Answer VerificationLanguage Model Generation Evaluation

  4. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1LLM EvaluationLLM-as-a-Judge

  5. Towards a Reliable and Practical Eval Pipeline

    Sep 1, 2026Emma Thuong Nguyen, Abhishek GhoseLLM EvaluationLLM-as-a-Judge

  6. Aggregate Disambiguation Systems

    Aug 31, 2026José María Lago, Albert Castellana, Edgars NemšeAnnotator DisagreementConfidence Region Estimation

  7. TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale

    Aug 31, 2026Sandeep Sricharan Mukku, Albert Aristotle Nanda, Rohit PyatiTopic ModelingSemantic Mapping

  8. XQDT: eXplainable and Quantitative Data-Text Alignment Metric with Feedback Signals

    Aug 30, 2026Kun Efimov-Zhang, Yifei Song, Claire GardentAutomated EvaluationExplainability Evaluation

  9. Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification

    Aug 27, 2026Jinghan Xu, Yikai Zhang, Aili Chen +3Agent Harness OptimizationLLM Agent Harnesses

  10. Research Design Tracking and Assessment for the Social Sciences

    Aug 27, 2026Marco Rovera, Sergiu Burlacu, Dominique Cappelletti +5Automated EvaluationCausal Inference

  11. Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation

    Aug 27, 2026Mingqi Gao, Anthony Sicilia, Weiyan ShiAutomated EvaluationMT Evaluation

  12. Image Augmentation as Test Generation for Deep Learning-Based Image Retrieval Systems

    Aug 27, 2026Yehan De Silva, Anirudh Sridhar, Armin Lotfy +6Data AugmentationImage Retrieval

  13. AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification

    Aug 26, 2026Zebei Zhao, Zhihao Shi, Minqi ShiLLM Answer VerificationAutomated Evaluation

  14. ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

    Aug 23, 2026Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. AgichteinLLM EvaluationRubric-Based Evaluation

  15. The geometry of AI validation: From structural blindness to reusable audits

    Aug 21, 2026Ricardo FitasAutomated EvaluationAlgorithmic Auditing

  16. From Subjective Judgments to Auditable Standards:Protocol-Guided AI Auditing of Website Redundancy

    Aug 21, 2026Ge Kong, Yongtong CaoAutomated Evaluation