LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

    Jul 9, 2026Ethan Leung, Elias Lumer, Corey Feld +3LLM-as-a-JudgeCitation Verification

  2. When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

    Jul 9, 2026Zongyou Yang, Yinghan Hou, Xiaokun YangLLM-as-a-JudgeLLM Auditing

  3. A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

    Jul 8, 2026A. Sayyad, J. Emmons, S. Jones +2Audio-Language Model EvaluationVoice Agent Evaluation

  4. The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

    Jul 8, 2026Xing Zhang, Yanwei Cui, Guanghui Wang +4LLM-as-a-JudgeLLM Agent Safety

  5. WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

    Jul 7, 2026Wei Dong, Tianyu Fu, Zhe Yu +9LLM-as-a-JudgeWeb Agent Benchmarks

  6. LLM-Based Test Oracles: Source-of-Authority Taxonomy -- A Systematic Literature Review

    Jul 6, 2026Ali Hassaan Mughal, Muhammad BilalSoftware EngineeringAutomated Software Testing

  7. Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

    Jul 2, 2026Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard +2LLM-as-a-JudgeComputer Science Education

  8. Challenges and Recommendations for LLM-as-a-Judge in Multilingual Settings and for Low-Resource Languages

    Jul 2, 2026A. Seza Doğruöz, Xixian Liao, Verena Blaschke +3Multilingual Language Model EvaluationLLM-as-a-Judge

  9. Ask the Right Comparison:Bias-Aware Bayesian Active Top-kk Ranking with LLM Judges

    Jul 2, 2026Jian Xu, Delu Zeng, John Paisley +1Pairwise ComparisonLLM-as-a-Judge

  10. Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

    Jul 2, 2026Dazhi Fu, Jiuding Yang, Yiwen Guo +1Reward ModelingLLM-as-a-Judge

  11. AGC-Bench: Measuring Artificial General Creativity

    Jul 1, 2026Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai +9Creativity AssessmentLLM Evaluation

  12. Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention

    Jul 1, 2026William Philipp, Finn Fassbender, Daniel Fister +12Multilingual Language Model EvaluationLLM-as-a-Judge

  13. LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

    Jul 1, 2026Ruotong Zhao, Zhiyu Chen, Xurui Liu +7Human Preference EvaluationLLM-as-a-Judge

  14. CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

    Jun 30, 2026Ajmal M., Abin Roy, Afthab Salam Kanniyan +4LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  15. Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

    Jun 30, 2026Zewen LiuLLM-as-a-JudgePairwise Preference Evaluation

  16. Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

    Jun 30, 2026Noah Scharrenberg, Chang SunLLM-as-a-JudgeLLM Auditing

  17. Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization

    Jun 30, 2026Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy +3LLM-as-a-JudgeLean Theorem Proving

  18. Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments

    Jun 29, 2026Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas +4LLM-as-a-JudgeProbabilistic Forecasting

  19. RoPoLL: Robust Panel of LLM Judges

    Jun 29, 2026Anish Acharya, Kris W Pan, Brian VerkhovskyLLM EvaluationLLM-as-a-Judge

  20. Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

    Jun 29, 2026Mizanur Rahman, Abeer Badawi, Elahe Rahimi +4Mental Health CounselingMulti-Agent LLM Systems

  21. Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?

    Jun 29, 2026Shanshan Wang, Derek F. Wong, Jingming Yao +1LLM EvaluationLLM-as-a-Judge