Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. How Benchmarks Mis-Score Computer-Use Agents

    Jul 30, 2026Zihan Dong, Zhiyuan Ma, Zekun Wang +5Agent Failure AnalysisComputer-Use Agent Benchmarks

  2. DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

    Jul 30, 2026Debin Meng, Jiaming Yang, Zefang Zong +4LLM Agent EvaluationAutomated Evaluation

  3. Evaluating and Pricing Advertisements in AI-Generated Responses

    Jul 30, 2026John L. Turner-Smith, Zimeng Huang, Yuhan Fu +2Mechanism DesignOnline Advertising

  4. Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

    Jul 29, 2026Jeff Mohl, Nelson Gardner-Challis, Magda Dubois +6Benchmark AuditingAI Agent Benchmarks

  5. SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

    Jul 29, 2026Zihan Deng, Chuanzhi Xu, Huiqi Liang +3Automated EvaluationImage Quality Assessment

  6. AnnoBench: A Benchmark for Visualization Annotation Generation

    Jul 28, 2026Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt +1Data VisualizationAutomated Evaluation

  7. Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification

    Jul 28, 2026Chenrui Shi, Yuwei Wu, Yang Liu +5RL for GUI AgentsAutomated Evaluation

  8. GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

    Jul 27, 2026Jiacheng Lu, Sinuo Wang, Wentao Zhao +12Quantitative FinanceFinancial Forecasting

  9. A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions

    Jul 25, 2026Zhijiang Tang, Jiaxin Qi, Kaihua Tang +2Image CaptioningAutomated Evaluation

  10. grapheme-kit: Grapheme-Level Metrics and Text Processing for Multilingual NLP

    Jul 24, 2026Izzath Nisfer, Ashini Kavindya, Ovindu Atukorala +2Automated Evaluation

  11. An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

    Jul 23, 2026Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright +1Audio UnderstandingAutomated Evaluation

  12. Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

    Jul 23, 2026Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar +1LLM EvaluationText Summarization

  13. Learning to Detect UI Principle Violations via Reinforcement Learning

    Jul 22, 2026Nishi Mehta, Swathi Alse, Himani Kumawat +2Automated EvaluationLanguage Model Auditing

  14. Assessment in Team Problem-Solving Exercises in Computing Education

    Jul 21, 2026Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk +3Educational AssessmentRubric-Based Evaluation

  15. Human Grounded Evaluation of Large Language Models for Optical Network Automation

    Jul 20, 2026Kiarash Rezaei, Omran Ayoub, Paolo Monti +1LLM Inference EfficiencyLLM Evaluation

  16. Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer

    Jul 19, 2026Jingjie Ning, Xiaochuan Li, Shanshan Zhong +2Automated Algorithm DiscoveryAutomated Evaluation

  17. Controlling Implicit Shortcut Reliance in L2 Spoken English Auto-markers

    Jul 17, 2026Shilin Gao, Mark J. F. Gales, Kate M. KnillEducational AssessmentAutomated Evaluation

  18. Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

    Jul 16, 2026Leanne Tan, Rohan Jaggi, Shaun Khoo +1Human-in-the-Loop EvaluationRubric-Based Evaluation

  19. DynEval: Holistic Evaluations of T2I Generative Models in the Wild

    Jul 13, 2026Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane +3VLM EvaluationAutomated Evaluation