LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

    Jun 12, 2026Daniel Lee, Harsh Sharma, Eunkyu Park +5LLM-as-a-JudgeLanguage Model Calibration

  2. On the Limits of LLM-as-Judge for Scientific Novelty Assessment

    Jun 10, 2026Soumitra Sinhahajari, Navonil Majumder, Soujanya PoriaAI for ScienceLLM-as-a-Judge

  3. RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

    Jun 8, 2026Yiteng Mao, Kenan Xu, Yijia Lyu +3Mathematical Reasoning BenchmarksLLM Evaluation

  4. Reasoning without Gold Standards: A Proxy-Judge Theory of Autoformalization

    Jun 8, 2026Lei Xu, Xin Quan, André FreitasLLM Self-RefinementLLM-as-a-Judge

  5. Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings

    Jun 8, 2026Mina Remeli, Moritz HardtPairwise ComparisonLLM-as-a-Judge

  6. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

    Jun 8, 2026Yongtaek Lim, Hyeji Choi, Minwoo KimLLM-as-a-JudgeLLM Safety Evaluation

  7. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1LLM-as-a-JudgeRubric-Based RL

  8. Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

    Jun 7, 2026Qilin Zhou, Zhuo Wang, Yue Li +1LLM EvaluationLLM-as-a-Judge

  9. Contemporary AI lacks the imagination to diverge or negate in science

    Jun 6, 2026Honglin Bao, Siyang Wu, Xiao Liu +3LLM-as-a-JudgeScientific Reasoning

  10. Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

    Jun 5, 2026Anissa Alloula, Federico Licini, Ava Batchkala +1LLM-as-a-JudgeIn-Context Learning

  11. SLMJury: Can Small Language Models Judge as Well as Large Ones?

    Jun 5, 2026Anish Laddha, Nitesh Pradhan, Gaurav SrivastavaLLM-as-a-JudgeLanguage Model Generation Evaluation

  12. Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

    Jun 5, 2026Xing Yue, Linjuan Wu, Daoxin Zhang +2Reward ModelingLLM Evaluation

  13. EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

    Jun 4, 2026Zhihao Wu, Linhai Zhang, Taiyi Wang +4LLM-as-a-JudgeRubric-Based Evaluation

  14. Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

    Jun 4, 2026Tao Liu, Ye Lu, Ruohua Zhang +4LLM EvaluationLLM-as-a-Judge

  15. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge

  16. Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

    Jun 3, 2026Xuekang Wang, Zhuoyuan Hao, Shuo Hou +3Reward HackingRL for Language Models

  17. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

    Jun 3, 2026Yanjing Ren, Reza Ebrahimi, TengTeng MaLLM Safety BenchmarksLLM-as-a-Judge

  18. AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

    Jun 2, 2026Sangwon Baek, Kyu Yeon Hur, Kyunga KimLLM-as-a-JudgeClinical Decision Support

  19. SenseJudge: Human-Centric Preference-Driven Judgment Framework

    Jun 2, 2026Rui Li, Junfeng Liu, Xiangwen Kong +2LLM EvaluationLLM-as-a-Judge