LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

    Jun 2, 2026Haitao Li, Tian Tan, Yuguang Yang +2Audio-Language Model EvaluationLLM-as-a-Judge

  2. LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

    Jun 1, 2026Aastha Sapkota, M. G. Sarwar MurshedLLM EvaluationLLM-as-a-Judge

  3. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

    Jun 1, 2026Seojeong Park, Jiho Choi, Junyong Kang +3Reward ModelingLLM-as-a-Judge

  4. Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

    Jun 1, 2026Junjie Chen, Yuxi Dong, Haitao Li +5LLM EvaluationLLM-as-a-Judge

  5. A Finite-Calibration Regime Map for LLM Judge Panels

    May 31, 2026Bin Zhu, Yanghui RaoLLM-as-a-JudgeLanguage Model Calibration

  6. Cost-Effective Automated Judging of Natural-Language Mathematical Proofs

    May 29, 2026Benjamin GrayzelLLM-as-a-JudgeAutomated Grading

  7. LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

    May 29, 2026Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij +1Multilingual Language Model EvaluationLLM-as-a-Judge

  8. A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

    May 29, 2026Yi Zhao, Siqi Wang, Zhe Hu +2VLM EvaluationLLM-as-a-Judge

  9. PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

    May 29, 2026Swastik Roy, Rajkumar Pujari, Tharindu Kumarage +5LLM-as-a-JudgeLLM Auditing

  10. Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge

    May 28, 2026Zijie Wang, Eduardo BlancoLLM-as-a-JudgeLanguage Model Generation Evaluation

  11. SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

    May 28, 2026Jiamin Chen, Yidi Wu, Qiexiang Wang +6LLM EvaluationLLM-as-a-Judge

  12. Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

    May 27, 2026Irune Zubiaga, Aitor Soroa, Rodrigo AgerriMultilingual Language Model EvaluationLLM-as-a-Judge

  13. Review Arcade: On the Human Alignment and Gameability of LLM Reviews

    May 27, 2026Hans Ole Hatzel, Sebastian Steindl, Jan StrichLLM-as-a-JudgeHuman-AI Agreement

  14. BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

    May 27, 2026Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach +6Legal NLPLLM Evaluation

  15. A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test

    May 27, 2026Camilo Chacón Sartori, José H. GarcíaRetrieval-Augmented GenerationLLM-as-a-Judge

  16. Cross-Entropy Games and Frost Training

    May 26, 2026Arthur Renard, Franck Gabriel, Valentin Hartmann +1RL for Language ModelsPolicy Gradient

  17. Debate Helps Weak Judges Reward Stronger Models

    May 26, 2026Ethan Elasky, Frank Nakasako, Naman GoyalScalable OversightLLM-as-a-Judge

  18. Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

    May 26, 2026Zixuan Yang, Yiqun Chen, Wei Yang +7Open-Ended GenerationReward Modeling

  19. JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

    May 26, 2026Jiho Jin, Junho Myung, Juhyun Oh +5Multilingual Language Model EvaluationLLM-as-a-Judge

  20. Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation

    May 26, 2026Lulu Zheng, Wenjin Yang, Xiangwen Zhang +4LLM AlignmentLLM-as-a-Judge

  21. A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

    May 25, 2026Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot +1Inter-Rater ReliabilityAnnotator Disagreement

  22. Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

    May 25, 2026Delip Rao, Chris Callison-BurchInter-Rater ReliabilityLLM Evaluation

  23. LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

    May 25, 2026Lingyao Li, Junjie Xiong, Changjia Zhu +5LLM EvaluationLLM-as-a-Judge

  24. JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

    May 24, 2026Russell Yang, Ruishi Chen, Pierce Kelaita +6Human Preference EvaluationLLM Evaluation

  25. Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

    May 24, 2026Xianglin Yang, Bryan Hooi, Gelei Deng +2LLM EvaluationLLM-as-a-Judge

  26. Instance-Optimal Estimation with Multiple LLM Judges on a Budget

    May 22, 2026Junghyun Lee, Sanghwa Kim, Yassir Jedra +2Parameter EstimationLLM Evaluation