Bias in LLM-as-a-Judge

Latest papers 48

All topics
CardsList
  1. Reliability of LLM Judges for Evaluating Entity Alignment

    Oct 7, 2026Vaibhava Lakshmi Ravideshik, Mayank KejriwalLLM-as-a-JudgeBias in LLM-as-a-Judge

  2. Will the Judge Flip? Predicting Position-Sensitive LLM Judgments from Residual Stream Activations

    Oct 5, 2026Hashmath Shaik, Gnaneswar Villuri, Alex DoboliLLM EvaluationLLM-as-a-Judge

  3. Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation

    Oct 1, 2026Yuan Huang, Zirui Song, Xiuying ChenVLM RobustnessLLM-as-a-Judge

  4. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  5. Debiasing as a Measurement Intervention: Calibrated Ties and Resolution Loss in LLM-as-a-Judge Evaluation

    Sep 14, 2026Liang Zhao, Yong Wang, Jiangzhe ChenLLM-as-a-JudgeLLM Agent Evaluation

  6. When Noise Fabricates Bias: The Fragility of LLM-as-a-Judge Bias Measurement under Noisy Text

    Sep 10, 2026DongHyun Ryu, Jaehyeok Lee, YeongJun Hwang +1LLM-as-a-JudgeSocial Bias in Language Models

  7. User Feedback Provides a Unique Signal that LLMs Can not Detect

    Sep 2, 2026Shachar Don-Yehiya, Leshem Choshen, Omri AbendLLM EvaluationRL from Human Feedback

  8. LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts

    Aug 31, 2026Daniela Occhipinti, Andrea Piergentili, Marco GueriniLLM-as-a-JudgeLLM Prompting

  9. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

    Aug 7, 2026Sahil Pardasani, Madhusudan SinghLLM EvaluationLLM-as-a-Judge

  10. Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

    Aug 6, 2026Yuma Asato, Kiyoaki Shirai, Natthawut KertkeidkachornLLM EvaluationLLM-as-a-Judge

  11. LLM Evaluators are Biased across Languages

    Jul 16, 2026Ej Zhou, Lucas Resck, Zheng Hui +1Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  12. The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

    Jul 15, 2026Serkan BallıMultilingual Language Model EvaluationLLM-as-a-Judge

  13. LLM Judges Can Be Too Generous When There Is No Reference Answer

    Jul 14, 2026Chalamalasetti Kranti, Sowmya VajjalaLLM EvaluationLLM-as-a-Judge

  14. Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias

    Jul 13, 2026Zixiang Xu, Sixian Li, Huaxing Liu +4LLM-as-a-JudgeLLM Interpretability

  15. Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

    Jul 9, 2026Ethan Leung, Elias Lumer, Corey Feld +3LLM-as-a-JudgeCitation Verification

  16. Ask the Right Comparison:Bias-Aware Bayesian Active Top-kk Ranking with LLM Judges

    Jul 2, 2026Jian Xu, Delu Zeng, John Paisley +1Pairwise ComparisonLLM-as-a-Judge

  17. RoPoLL: Robust Panel of LLM Judges

    Jun 29, 2026Anish Acharya, Kris W Pan, Brian VerkhovskyLLM EvaluationLLM-as-a-Judge

  18. Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

    Jun 17, 2026Justin D. Norman, Michael U. Rivera, D. Alex HughesInter-Rater ReliabilityLLM Evaluation

  19. Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

    Jun 17, 2026Zilong Zhang, Yi-Ting Hung, Lei Ding +1Inverse Optimal TransportLLM-as-a-Judge

  20. Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

    Jun 16, 2026Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed +3LLM-as-a-JudgeSocial Bias in Language Models

  21. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

    Jun 14, 2026Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi +1LLM EvaluationLLM-as-a-Judge

  22. Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

    Jun 12, 2026Daniel Lee, Harsh Sharma, Eunkyu Park +5LLM-as-a-JudgeLanguage Model Calibration

  23. Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

    May 24, 2026Xianglin Yang, Bryan Hooi, Gelei Deng +2LLM EvaluationLLM-as-a-Judge