LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

    Apr 6, 2026Alhasan Mahmood, Samir Abdaljalil, Hasan KurbanMultilingual Language Model EvaluationLLM-as-a-Judge

  2. Mediocrity is the key for LLM as a Judge Anchor Selection

    Mar 17, 2026Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen +1LLM-as-a-JudgePairwise Preference Evaluation

  3. LLM-as-a-judge validity in physics assessment depends more on the task than the model

    Mar 16, 2026Will Yeadon, Tom Hardy, Paul Mackay +1LLM-as-a-JudgeEducational Assessment

  4. MultiwayPAM: Multiway Partitioning Around Medoids for LLM-as-a-Judge Score Analysis

    Mar 11, 2026Chihiro Watanabe, Jingyu SunLLM-as-a-JudgeClustering

  5. Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization

    Mar 9, 2026Hongli Zhou, Hui Huang, Rui Zhang +5LLM-as-a-JudgeSocial Bias in Language Models

  6. Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

    Feb 14, 2026Ruomeng Ding, Yifei Pang, He Sun +3LLM AlignmentLLM-as-a-Judge

  7. CLASE: A Hybrid Method for Chinese Legalese Stylistic Evaluation

    Feb 13, 2026Yiran Rex Ma, Yuxiao Ye, Huiyuan XieAutomated EvaluationLegal NLP

  8. CARE: Confounder-Aware Aggregation for Reliable LLM Evaluation

    Feb 9, 2026Jitian Zhao, Changho Shin, Tzu-Heng Huang +2LLM EvaluationLLM-as-a-Judge

  9. FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

    Feb 6, 2026Bo Yang, Lanfei Feng, Yunkui Chen +3LLM EvaluationLLM-as-a-Judge

  10. JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

    Feb 6, 2026Lanbo Lin, Jiayao Liu, Tianyuan Yang +5LLM-as-a-JudgeAI Agent Evaluation

  11. MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

    Feb 3, 2026Vishal Venkataramani, Haizhou Shi, Zixuan Ke +6Multi-Agent LLM SystemsLLM-as-a-Judge

  12. Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

    Jan 30, 2026Zhuochun Li, Yong Zhang, Ming Li +8LLM EvaluationLLM-as-a-Judge

  13. Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

    Jan 30, 2026Dani Roytburg, Matthew Bozoukov, Matthew Nguyen +3LLM-as-a-JudgeLanguage Model Generation Evaluation

  14. ReportLogic: Evaluating Logical Quality in Deep Research Reports

    Jan 27, 2026Jujia Zhao, Zhaoxin Huan, Zihan Wang +4LLM-as-a-JudgeAutomated Evaluation

  15. From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

    Jan 13, 2026Yihan Hong, Huaiyuan Yao, Bolin Shen +3LLM-as-a-JudgeRubric-Based Evaluation

  16. Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

    Jan 7, 2026Yao Dou, Benjamin Mamut, Wei XuLegal NLPLLM Evaluation

  17. ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

    Nov 28, 2025Šimon Sedláček, Sara Barahona, Bolaji Yusuf +9Audio-Language Model EvaluationLLM Evaluation

  18. Idea2Plan: Exploring AI-Powered Research Planning

    Oct 28, 2025Jin Huang, Silviu Cucerzan, Sujay Kumar Jauhar +1LLM EvaluationLLM-as-a-Judge

  19. User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

    Oct 23, 2025Xiaoyuan Wu, Roshni Kaushik, Wenkai Li +2LLM EvaluationLLM-as-a-Judge

  20. Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

    Sep 3, 2025Dani Roytburg, Matthew Bozoukov, Matthew Nguyen +3LLM-as-a-JudgeLanguage Model Steering

  21. Expert Preference-based Evaluation of Automated Related Work Generation

    Aug 11, 2025Furkan Şahinuç, Subhabrata Dutta, Iryna GurevychHuman Preference EvaluationLLM-as-a-Judge

  22. Evaluating Style-Personalized Text Generation: Challenges and Directions

    Aug 8, 2025Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  23. Structured Prompting and Automated Evaluation in Fixed Synthetic Japanese-Language Counseling Dialogues

    Jun 28, 2025Keita Kiuchi, Yoshikazu Fujimoto, Hideyuki Goto +5Mental Health CounselingLLM-as-a-Judge

  24. Multimodal Language Models as Text-to-Image Model Evaluators

    May 1, 2025Jiahui Chen, Candace Ross, Reyhane Askari-Hemmat +5LLM-as-a-JudgeBenchmark Design

  25. Evaluating the Evaluator: Summarization Metrics and LLM-Judges beyond English

    Mar 21, 2025Jeremy Barnes, Naiara Perez, Alba Bonet-Jover +1Summarization EvaluationAutomated Evaluation

  26. No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

    Mar 7, 2025Michael Krumdick, Charles Lovering, Varshini Reddy +2LLM EvaluationLLM-as-a-Judge

  27. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Date pendingRui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge