Automated Evaluation

Momentum

48 papers in the last four weeks, up 12% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 321

All topics
CardsList
  1. RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

    Jun 2, 2026Zongwei Lv, Zhewen Tan, Yaoming Li +7Computer-Use Agent BenchmarksAI Coding Agents

  2. WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts

    Jun 2, 2026Yuxin Meng, Yuhan Suo, Junjie Wang +9Automated Software TestingAutomated Evaluation

  3. Any2Poster: Any-Source Poster Generation Across Modalities and Domains

    Jun 1, 2026Amogh Vinaykumar, Aiden Li, Suozhi Huang +1Image GenerationMultimodal Generation

  4. RWGBench: Evaluating Scholarly Positioning in Related Work Generation

    May 30, 2026Anzhe Xie, Weihang Su, Jiaxin Mao +4LLM EvaluationAutomated Evaluation

  5. Refining Word-Based Grammatical Error Annotation for L2 Korean

    May 28, 2026Jungyeul Park, Kyungtae Lim, Wonjun Oh +4Grammatical Error CorrectionAutomated Evaluation

  6. A Novel Evaluation Metric for Unsupervised Learning in AIS-Based Maritime Anomaly Detection: MADQI

    May 28, 2026Ismet Gocer, Zakirul Bhuiyan, Raza Hasan +1Unsupervised Anomaly DetectionAutomated Evaluation

  7. Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets

    May 28, 2026Zhichao Chen, Yongle Zhao, Kaicheng Yang +3Face RecognitionAutomated Evaluation

  8. Benchmarking AI for low-resource contexts: Thinking beyond leaderboards

    May 27, 2026Aakash Pant, Kavya Shah, Apoorv Agnihotri +3Benchmark DesignAutomated Evaluation

  9. AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

    May 26, 2026Yifan Sui, Xin Huang, Hongbing Li +14Mobile GUI AutomationComputer-Use Agent Benchmarks

  10. MATCHA: Matching Text via Contrastive Semantic Alignment

    May 26, 2026Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1LLM EvaluationSemantic Textual Similarity

  11. GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

    May 26, 2026Yihang Lin, Yunze Gao, Zeyang Lin +3Benchmark DesignHuman-in-the-Loop Evaluation

  12. HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

    May 26, 2026Jiajun Wu, Jian Yang, Tuney Zheng +4Automated Software TestingAutomated Program Repair

  13. Workflow Closure Is Not Scientific Closure in Auto-Research Systems

    May 25, 2026Shuai Wang, Xinyuan Tian, Pangpang Liu +1Human-in-the-Loop EvaluationAutonomous Scientific Discovery

  14. RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations

    May 25, 2026Hanyu Li, Yichi Zhang, Speed Zhu +3AI Coding AgentsSoftware Engineering Benchmarks

  15. A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback

    May 25, 2026Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen +7Educational TechnologyAutomated Evaluation

  16. AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

    May 23, 2026Jialiang Yang, Bin Xia, Ruihang Chu +6Audio-Video GenerationAudio-Visual Alignment

  17. Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

    May 22, 2026Zhimin Zhao, Zehao Wang, Abdul Ali Bangash +2Software EngineeringAutomated Evaluation

  18. Learning to Evaluate: Cost-Effective Model Evaluation on Unlabeled Data with Meta-Learning

    May 22, 2026Trinh Pham, Viet Huynh, Hongzhi Yin +2Automated Evaluation

  19. AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

    May 21, 2026Hanjun Luo, Zhimu Huang, Sylvia Chung +6T2I GenerationAgent Evaluation

  20. Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

    May 21, 2026Asaf Yehudai, Lilach Eden, Michal Shmueli-ScheuerLLM Agent EvaluationAI Agent Benchmarks

  21. Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

    May 20, 2026Amit Roth, Ankur Samanta, Matan Halevy +2Reward HackingAI Agent Benchmarks

  22. OpenComputer: Verifiable Software Worlds for Computer-Use Agents

    May 19, 2026Jinbiao Wei, Qianran Ma, Yilun Zhao +4Computer-Use Agent BenchmarksComputer-Use Agents