LLM-as-a-Judge

Latest papers 362

All topics
CardsList
  1. All Verdicts are Not Equal: Rethinking LLM Judge Reliability

    Oct 8, 2026Vineet Kumar, Darshita Rathore, Anindya MoitraLLM-as-a-JudgeLLM Evaluation

  2. Who Verifies the Verifier? Co-Evolving Inspectable Graders with Self-Improving Agents

    Oct 8, 2026Xing Zhang, Guanghui Wang, Yanwei Cui +4Automated EvaluationLLM Agent Self-Improvement

  3. How to post-train on a surrogate: Envelope sampling mitigates reward hacking

    Oct 8, 2026Sanjit Dandapanthula, Shuvom Sadhuka, Samir Khan +3RL Post-TrainingReward Hacking

  4. AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks

    Oct 8, 2026Xing Han Lù, Dheeraj Vattikonda, Sina Hajimiri +7Computer-Use Agent BenchmarksLong-Horizon Agent Evaluation

  5. Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression

    Oct 7, 2026Mingqing Yuan, Xiaobo Liang, Junwei Yang +5Reward ModelingLLM-as-a-Judge

  6. Reliability of LLM Judges for Evaluating Entity Alignment

    Oct 7, 2026Vaibhava Lakshmi Ravideshik, Mayank KejriwalLLM-as-a-JudgeBias in LLM-as-a-Judge

  7. Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions

    Oct 6, 2026Wenqi Li, Bin Liu, Mindi Ruan +3LLM EvaluationLLM-as-a-Judge

  8. Same-Number Citation Swaps: Stress-Testing Jev as a Financial Evidence Judge

    Oct 6, 2026Chuhong Xu, Bo Su, Ziyao Chen +3LLM-as-a-JudgeCitation Verification

  9. The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation

    Oct 6, 2026Jorma Valjakka, Juhani Kivimäki, Juha Mylläri +1LLM EvaluationLLM-as-a-Judge

  10. Will the Judge Flip? Predicting Position-Sensitive LLM Judgments from Residual Stream Activations

    Oct 5, 2026Hashmath Shaik, Gnaneswar Villuri, Alex DoboliLLM EvaluationLLM-as-a-Judge

  11. JudgeMoE: Distributional Aggregation for LLM-as-a-Judge

    Oct 5, 2026Yiqi Liu, Joseph James, Yang Wang +3LLM EvaluationLLM-as-a-Judge

  12. VERA: Verdict-Conditioned Reliability for Adaptive LLM Judges

    Oct 4, 2026Qiushui Xu, Syamil Mohd Razak, Tao Yuan +1LLM-as-a-JudgeLLM Fine-Tuning

  13. How Much Do LLM-as-a-Judge Design Choices Matter? A Systematic Comparison of Prompt Designs, Rating Scales, and Models

    Oct 4, 2026Laurène Vaugrante, Thilo HagendorffLLM EvaluationLLM-as-a-Judge

  14. Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation

    Oct 1, 2026Noy Sternlicht, Simra Shahid, Peter Jansen +3Prompt SensitivityLLM-as-a-Judge

  15. Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation

    Oct 1, 2026Yuan Huang, Zirui Song, Xiuying ChenVLM RobustnessLLM-as-a-Judge

  16. AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation

    Oct 1, 2026Giulio Zeloni, Enrico Lo Conte, Salvatore Rionero +3LLM-as-a-JudgeRAG Evaluation

  17. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  18. RAIM: Robust Aggregation of Inexpensive Models for Hallucination Detection

    Sep 30, 2026Elia Onofri, Roberto Di PietroLLM EvaluationLLM-as-a-Judge

  19. Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

    Sep 30, 2026Ilgee Hong, Changlong Yu, Zhenghao Xu +5LLM-as-a-JudgeLanguage Model Distillation

  20. Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image Assessment

    Sep 29, 2026Yu Zhao, Jiarui Wang, Huiyu Duan +5LLM-as-a-JudgeImage Generation Evaluation