LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. IROH: Insightful Ranking Of Humor using Multi-Stage Hybrid Retrieval with Rationale-Distilled LLM Judges for JOKER 2026 Track Task 1 English

    Sep 14, 2026Ana-Maria Luisa Mocanu, Sebastian Mocanu, Ciprian-Octavian Truica +1LLM-as-a-JudgeHybrid Retrieval

  2. Can We Trust the Judges? Validation of Factuality Evaluation Methods via Answer Perturbation

    Sep 14, 2026Sarra Gharsallah, Adele Robaldo, Mariia Tokareva +5LLM EvaluationLLM-as-a-Judge

  3. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  4. Debiasing as a Measurement Intervention: Calibrated Ties and Resolution Loss in LLM-as-a-Judge Evaluation

    Sep 14, 2026Liang Zhao, Yong Wang, Jiangzhe ChenLLM-as-a-JudgeLLM Agent Evaluation

  5. Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents

    Sep 11, 2026Toshiaki Koike-Akino, Vladislav Blaykhman, Ye Wang +2LLM Self-RefinementLLM-as-a-Judge

  6. Scaling Clinical Judgment to Evaluate Medical AI

    Sep 11, 2026Thomas A. Buckley, Zahir Kanjee, Peter G. Brodeur +15LLM-as-a-JudgeLLM Fine-Tuning

  7. When Noise Fabricates Bias: The Fragility of LLM-as-a-Judge Bias Measurement under Noisy Text

    Sep 10, 2026DongHyun Ryu, Jaehyeok Lee, YeongJun Hwang +1LLM-as-a-JudgeSocial Bias in Language Models

  8. XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?

    Sep 10, 2026Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein +1Explainable Artificial IntelligenceLLM-as-a-Judge

  9. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  10. EviSI: An Evidence-Based Evaluation Agent for Simultaneous Interpreting

    Sep 8, 2026Ben Yan, Zongyao Li, Xiaoyu Chen +6LLM-as-a-JudgeSimultaneous Speech Translation

  11. Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

    Sep 3, 2026Haoyaun Zhu, Jie ZhangLLM EvaluationLLM-as-a-Judge

  12. Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection

    Sep 3, 2026Joe Cecil, Marjorie FreedmanLLM-as-a-JudgeFactual Consistency Evaluation

  13. Decoupled Analysis-Judging: An Automated Creativity Evaluator Using LLMs in Complex Multi-step Creativity Tasks

    Sep 3, 2026Xiangyu Wang, Jin Wu, Xiaoyu Li +2Creativity AssessmentLLM-as-a-Judge

  14. RadMatch: Auditable Radiology Report Evaluation via Finding-Level Matching

    Sep 1, 2026Charles Corbière, Léo Machado, Aubin Charley +3LLM-as-a-JudgeMedical Image Benchmarks

  15. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1LLM EvaluationLLM-as-a-Judge

  16. Post-hoc Alignment of LLM-judges to Human Judgment Distribution

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1Soft-Label LearningLLM Alignment

  17. Towards a Reliable and Practical Eval Pipeline

    Sep 1, 2026Emma Thuong Nguyen, Abhishek GhoseLLM EvaluationLLM-as-a-Judge

  18. LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts

    Aug 31, 2026Daniela Occhipinti, Andrea Piergentili, Marco GueriniLLM-as-a-JudgeLLM Prompting