LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following

    May 5, 2026Jaeyun Lee, Junyoung Koh, Zeynel Tok +2LLM EvaluationLLM-as-a-Judge

  2. Stop Automating Peer Review Without Rigorous Evaluation

    May 4, 2026Joachim Baumann, Jiaxin Pei, Sanmi Koyejo +1LLM-as-a-JudgeScholarly Peer Review

  3. Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

    May 2, 2026Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge

  4. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2VLM EvaluationVision-Language Models

  5. ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

    Apr 28, 2026Sidi Chang, Peiying Zhu, Yuxiao ChenLLM-as-a-JudgeAI Agent Evaluation

  6. Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

    Apr 27, 2026Aaryan Shah, Andrew Hines, Alexia Downs +6LLM-as-a-JudgeHuman-AI Agreement

  7. Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

    Apr 27, 2026Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar +1LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  8. Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

    Apr 27, 2026Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl +1LLM EvaluationLLM-as-a-Judge

  9. How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

    Apr 27, 2026Xinran ZhangLLM Safety BenchmarksLLM-as-a-Judge

  10. JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

    Apr 26, 2026Rohith Reddy Bellibatlu, Edward Raff, Wenbin ZhangLLM EvaluationLLM-as-a-Judge

  11. Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

    Apr 24, 2026Erez Yosef, Oron Anschel, Shunit Haviv Hakimi +4Mathematical Reasoning BenchmarksLLM Evaluation

  12. Aggregate vs. Personalized Judges in Business Idea Evaluation: Evidence from Expert Disagreement

    Apr 24, 2026Wataru Hirota, Tomoki Taniguchi, Tomoko Ohkuma +6Human Preference EvaluationAnnotator Disagreement

  13. Quantifying and Mitigating Self-Preference Bias of LLM Judges

    Apr 24, 2026Jinming Yang, Zheng Hu, Chuxian Qiu +3LLM-as-a-JudgeLanguage Model Bias Evaluation

  14. Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization

    Apr 22, 2026Mohamed Hesham Elganayni, Runsheng Chen, Sebastian Nagl +1LLM EvaluationLLM-as-a-Judge

  15. The Effect of Idea Elaboration on the Automatic Assessment of Idea Originality

    Apr 22, 2026Umberto Domanti, Moritz Mock, Sergio Agnoli +1Creativity AssessmentLLM-as-a-Judge

  16. HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

    Apr 21, 2026Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo +7LLM EvaluationLLM-as-a-Judge

  17. Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

    Apr 20, 2026Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel +1Semantic Textual SimilarityLLM-as-a-Judge

  18. AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

    Apr 20, 2026Wentao Shi, Yu Wang, Yuyang Zhao +8LLM-as-a-JudgeLLM Agent Evaluation

  19. Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

    Apr 20, 2026Lorenz Brehme, Thomas Ströhle, Ruth BreuMulti-Hop QALLM-as-a-Judge

  20. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Apr 20, 2026Sua Lee, Sanghee Park, Jinbae ImLLM-as-a-JudgeMultimodal Large Language Models

  21. TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

    Apr 19, 2026Yirong Zeng, Yufei Liu, Xiao Ding +9Reward ModelingLLM Alignment

  22. Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

    Apr 18, 2026Zixiao Zhao, Amirreza Esmaeili, Fatemeh FardSoftware EngineeringLLM-as-a-Judge

  23. How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models

    Apr 17, 2026Judith Sieker, Sina ZarrießLLM EvaluationLLM-as-a-Judge

  24. Context Over Content: Exposing Evaluation Faking in Automated Judges

    Apr 16, 2026Manan Gupta, Inderjeet Nair, Lu Wang +1LLM-as-a-JudgeLanguage Model Safety Evaluation

  25. Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

    Apr 16, 2026Amy Rouillard, Sitwala Mundia, Linda Camara +8LLM-as-a-JudgeHealthcare