LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. Small Language Models as Judges for Rubric-Based Reinforcement Learning

    Aug 30, 2026Fengyu Xie, Yilun Zhao, Bingsen Chen +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  2. GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

    Aug 30, 2026Yifan Chen, Haitao Li, Qingyao Ai +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  3. Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment

    Aug 30, 2026Zhiyu Chen, Keyu Zhao, Jigao Fu +8AI Agents for Scientific DiscoveryLLM-as-a-Judge

  4. Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit

    Aug 27, 2026Shuyi Fan, Boyuan Deng, Mengyu Xu +3Causal InferenceLLM Auditing

  5. Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

    Aug 26, 2026Jia-Hao Ji, Sijie Li, Jiabei Cheng +3LLM-as-a-JudgeMulti-Agent Reasoning

  6. Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

    Aug 25, 2026Anupam Purwar, Shashank Singh, Kritika SrivastavaVoice Agent EvaluationLLM-as-a-Judge

  7. Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

    Aug 21, 2026Emma Granqvist, Rocío Mercado, Samuel GenhedenAI Agents for Scientific DiscoveryLLM-as-a-Judge

  8. The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

    Aug 18, 2026Emma Yanyang Kong, JJ Tan, Ishan Gupta +8LLM EvaluationLLM-as-a-Judge

  9. Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

    Aug 12, 2026Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar +2LLM EvaluationLLM-as-a-Judge

  10. Benchmarking LLM Judges for Mobile Agent Evaluation

    Aug 11, 2026Ziqiang Wan, Li Gu, Zhixiang Chi +4LLM-as-a-JudgeLLM Agent Evaluation

  11. DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

    Aug 11, 2026Xiaotong Wang, Dazhen DengData VisualizationLLM-as-a-Judge

  12. Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

    Aug 11, 2026Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie +1LLM EvaluationLLM-as-a-Judge

  13. RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement

    Aug 10, 2026Ziheng Jia, Jiaying Qian, Zicheng Zhang +3LLM-as-a-JudgeRubric-Based Evaluation

  14. DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

    Aug 8, 2026Anthony Miyaguchi, Conor JohnstonLLM EvaluationLLM-as-a-Judge

  15. Evaluator Ensembles Under Reward Hacking: Covariance Geometry and Finite-Search Guarantees

    Aug 8, 2026Fariya Afrin, Ibne Farabi ShihabReward HackingLLM Evaluation

  16. When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

    Aug 7, 2026Yiyao Zhang, Diksha Goel, Hussain Ahmad +2LLM-as-a-JudgeLLM Reliability

  17. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

    Aug 7, 2026Sahil Pardasani, Madhusudan SinghLLM EvaluationLLM-as-a-Judge

  18. SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators

    Aug 7, 2026Yuheng Zhang, Yuanchun Wang, Fanjin Zhang +4LLM-as-a-JudgeAutomated Evaluation

  19. Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering

    Aug 7, 2026Xiuwei Shang, Li Hu, Xiao Jiang +7LLM-as-a-JudgeSoftware Reverse Engineering

  20. Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

    Aug 6, 2026Yuma Asato, Kiyoaki Shirai, Natthawut KertkeidkachornLLM EvaluationLLM-as-a-Judge

  21. SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

    Aug 6, 2026Zhi Han, Chenxi Zeng, Liuhaichen Yang +3LLM-as-a-JudgeLong-Horizon Agent Evaluation