60 papers in the last four weeks, up 76% on the four weeks before. 0.6% of all new papers.
May 5, 2026·Jaeyun Lee, Junyoung Koh, Zeynel Tok +2LLM EvaluationLLM-as-a-Judge
University of Oxford · Yonsei University
May 4, 2026·Joachim Baumann, Jiaxin Pei, Sanmi Koyejo +1LLM-as-a-JudgeScholarly Peer Review
Stanford University · Bocconi University
May 2, 2026·Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge
Maritaca AI · Jusbrasil
Apr 28, 2026·Divake Kumar, Sina Tayebati, Devashri Naik +2VLM EvaluationVision-Language Models
University of Illinois at Chicago · 2AI Labs at Capital One
Apr 28, 2026·Sidi Chang, Peiying Zhu, Yuxiao ChenLLM-as-a-JudgeAI Agent Evaluation
Blossom AI Labs, Tokyo, Japan · Blossom AI, San Francisco, USA
Apr 27, 2026·Aaryan Shah, Andrew Hines, Alexia Downs +6LLM-as-a-JudgeHuman-AI Agreement
1Canvas Medical, San Francisco, CA, USA · Department of Biomedical Data Science, Stanford University, Stanford, CA, USA · 3XPC (X Primary Care) +2
Apr 27, 2026·Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar +1LLM-as-a-JudgeHuman-in-the-Loop Evaluation
Bilkent University Ankara, Turkey · Beko İstanbul, Turkey
Apr 27, 2026·Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl +1LLM EvaluationLLM-as-a-Judge
Technical University of Munich Munich, Germany · Polytechnic University of Bari Bari, Italy
Apr 27, 2026·Xinran ZhangLLM Safety BenchmarksLLM-as-a-Judge
University of California, Berkeley, Berkeley CA 94720, USA
Apr 26, 2026·Rohith Reddy Bellibatlu, Edward Raff, Wenbin ZhangLLM EvaluationLLM-as-a-Judge
Florida International University, Miami, FL · CrowdStrike, New York, USA · University of Maryland Baltimore County, Baltimore, USA
Apr 25, 2026·Sadman Kabir SoumikDebiased MLLLM-as-a-Judge
Independent Researcher
Apr 24, 2026·Erez Yosef, Oron Anschel, Shunit Haviv Hakimi +4Mathematical Reasoning BenchmarksLLM Evaluation
Tel-Aviv University · Amazon Prime Video · Ben-Gurion University
Apr 24, 2026·Wataru Hirota, Tomoki Taniguchi, Tomoko Ohkuma +6Human Preference EvaluationAnnotator Disagreement
1Stockmark Inc · 2Asahi Kasei Corporation · National Institute of Informatics +1
Apr 24, 2026·Jinming Yang, Zheng Hu, Chuxian Qiu +3LLM-as-a-JudgeLanguage Model Bias Evaluation
CompleX Lab, School of Computer Science and Engineering, University of Electronic Science and Technology of China, Chengdu, China
Apr 23, 2026·Abel YagubyanInter-Rater ReliabilityLLM Evaluation
Apr 22, 2026·Mohamed Hesham Elganayni, Runsheng Chen, Sebastian Nagl +1LLM EvaluationLLM-as-a-Judge
Technical University of Munich Germany
Apr 22, 2026·Umberto Domanti, Moritz Mock, Sergio Agnoli +1Creativity AssessmentLLM-as-a-Judge
Free University of Bozen-Bolzano · University of Trieste · Marconi Institute for Creativity
Apr 21, 2026·Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo +7LLM EvaluationLLM-as-a-Judge
Department of Computer Science and Technology, Tsinghua University
Apr 20, 2026·Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel +1Semantic Textual SimilarityLLM-as-a-Judge
Pacific Northwest National Laboratory · Washington University in St. Louis · Humana Inc.
Apr 20, 2026·Wentao Shi, Yu Wang, Yuyang Zhao +8LLM-as-a-JudgeLLM Agent Evaluation
University of Science and Technology of China · National University of Singapore · Meituan
Apr 20, 2026·Lorenz Brehme, Thomas Ströhle, Ruth BreuMulti-Hop QALLM-as-a-Judge
Universität Innsbruck, Technikerstraße 21a, 6020 Innsbruck, Austria
Apr 20, 2026·Sua Lee, Sanghee Park, Jinbae ImLLM-as-a-JudgeMultimodal Large Language Models
Seoul National University · NAVER Cloud AI · KAIST AI
Apr 20, 2026·Arther Tian, Alex Ding, Frank Chen +2LLM EvaluationLLM-as-a-Judge
DGrid AI
Apr 19, 2026·Yirong Zeng, Yufei Liu, Xiao Ding +9Reward ModelingLLM Alignment
Harbin Institute of Technology SCIR Lab · Peking University · Huawei Technologies Co., Ltd
Apr 18, 2026·Zixiao Zhao, Amirreza Esmaeili, Fatemeh FardSoftware EngineeringLLM-as-a-Judge
University of British Columbia, Canada
Apr 17, 2026·Bhaskar GurramAI Agent ReliabilityTool-Augmented Language Model Agents
Zasti Inc., Ashburn, VA, USA
Apr 17, 2026·Judith Sieker, Sina ZarrießLLM EvaluationLLM-as-a-Judge
Computational Linguistics, Department of Linguistics Bielefeld University, Germany
Apr 16, 2026·Manan Gupta, Dhruv KumarLLM EvaluationLLM-as-a-Judge
1BITS Pilani, Pilani Campus, India
Apr 16, 2026·Manan Gupta, Inderjeet Nair, Lu Wang +1LLM-as-a-JudgeLanguage Model Safety Evaluation
1BITS Pilani, India · University of Michigan
Apr 16, 2026·Amy Rouillard, Sitwala Mundia, Linda Camara +8LLM-as-a-JudgeHealthcare
aWits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa · fSchool of Computer Science and Applied Mathematics, University of the Witwatersrand, Johannesburg, South Africa · bGrai Labs, Cape Town, South Africa +3