LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. Open Problems in Constitutional Preference Reconstruction

    Jun 29, 2026Eleanor Clifford, Michael Amir, Arduin Findeis +2LLM-as-a-JudgeLLM Decision-Making

  2. Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

    Jun 29, 2026Yangda Peng, Yunjia Qi, Haotian Xia +8LLM-as-a-JudgeAI Agent Benchmarks

  3. How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

    Jun 29, 2026William Orwig, Roger E. BeatyCreativity AssessmentLLM-as-a-Judge

  4. Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch

    Jun 27, 2026Katja Berčič, Slobodan StanojevikjLLM-as-a-JudgeClassification

  5. Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

    Jun 25, 2026Sangwoo Cho, Kushal Chawla, Pengshan Cai +4LLM EvaluationLLM-as-a-Judge

  6. Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

    Jun 23, 2026Tian Zheng, Kai-Tai HsuLLM-as-a-JudgeHuman-in-the-Loop Evaluation

  7. Steer, Don't Solve: Training Small Critic Models for Large Code Agents

    Jun 20, 2026Shubham Gandhi, Yiqing Xie, Atharva Naik +2LLM-as-a-JudgeAI Coding Agents

  8. Counsel: A Meta-Evaluation Dataset for Agentic Tasks

    Jun 19, 2026Sashank Pisupati, Henry Broomfield, Eujeong Choi +5LLM-as-a-JudgeLLM Agent Evaluation

  9. AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing

    Jun 18, 2026Zilong Zhang, Yi-Ting Hung, Weiyi He +3LLM-as-a-JudgeLLM Auditing

  10. Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

    Jun 17, 2026Justin D. Norman, Michael U. Rivera, D. Alex HughesInter-Rater ReliabilityLLM Evaluation

  11. Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

    Jun 17, 2026Zilong Zhang, Yi-Ting Hung, Lei Ding +1Inverse Optimal TransportLLM-as-a-Judge

  12. LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

    Jun 16, 2026Xiwei Xu, Chen Wang, Jacky Jiang +5LLM-as-a-JudgeEducational Assessment

  13. Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

    Jun 16, 2026Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed +3LLM-as-a-JudgeSocial Bias in Language Models

  14. PaperJury: Due-Process Review for Bounded LaTeX Revision

    Jun 15, 2026Yiran Wang, Ruixuan An, Biao Wu +1LLM-as-a-JudgeScholarly Peer Review

  15. UXBench: Measuring the Actionability of LLM-Generated UX Critiques

    Jun 15, 2026Wenjie Wang, Yue Huang, Zipeng Ling +11LLM-as-a-JudgeLLM Agent Evaluation

  16. SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

    Jun 14, 2026Ismail Hossain, Sai Puppala, Md Jahangir Alam +2LLM-as-a-JudgeLLM Agent Security

  17. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

    Jun 14, 2026Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi +1LLM EvaluationLLM-as-a-Judge

  18. On the Adversarial Robustness of Multimodal LLM Judges

    Jun 14, 2026Zihan Wang, Guansong Pang, Zelin Liu +3LLM-as-a-JudgeAdversarial Robustness

  19. Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

    Jun 12, 2026Alyssa Unell, Natalie Dullerud, Naomi Boneh +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  20. Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

    Jun 12, 2026Kirill Vasilevski, Ximing Dong, Benjamin Rombaut +8Software Engineering AgentsLLM-as-a-Judge