Rubric-Based Evaluation

Momentum

18 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 136

All topics
CardsList
  1. Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

    May 28, 2026Yun Wang, Xin Xia, Xuansheng Wu +2Automated Essay ScoringRubric-Based Evaluation

  2. GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

    May 26, 2026Yihang Lin, Yunze Gao, Zeyang Lin +3Benchmark DesignHuman-in-the-Loop Evaluation

  3. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9Multi-Objective Reinforcement LearningRL for Language Models

  4. A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

    May 25, 2026Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot +1Inter-Rater ReliabilityAnnotator Disagreement

  5. JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

    May 24, 2026Russell Yang, Ruishi Chen, Pierce Kelaita +6Human Preference EvaluationLLM Evaluation

  6. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning

  7. Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

    May 19, 2026Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei +5Reward ModelingRubric-Based RL

  8. Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs

    May 18, 2026Jacob Levine, Miguel Aenlle, Craig Zilles +2VLM EvaluationRubric-Based Evaluation

  9. AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning

    May 18, 2026Peilin Wu, Xinlu Zhang, Kun Wan +4RL for Language ModelsReinforcement Learning

  10. AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

    May 17, 2026Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban +1VLM EvaluationRubric-Based Evaluation

  11. QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

    May 17, 2026Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare +1LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  12. Reward Hacking in Rubric-Based Reinforcement Learning

    May 12, 2026Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3Reward HackingReinforcement Learning

  13. RETUYT-INCO at BEA 2026 Shared Task 2: Meta-prompting in Rubric-based Scoring for German

    May 11, 2026Ignacio Sastre, Ignacio Remersaro, Facundo Díaz +4LLM PromptingRubric-Based Evaluation

  14. RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

    May 11, 2026Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang +9Reinforcement LearningRubric-Based RL

  15. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  16. Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

    May 8, 2026Juanxi Tian, Fengyuan Liu, Jiaming Han +6Policy OptimizationMultimodal Reward Modeling

  17. Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering

    May 8, 2026Zewei Tian, Alex Liu, Lief Esbenshade +6Educational AssessmentGenerative AI in Education

  18. Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

    May 8, 2026Jiachen Yu, Zhihao Xu, Junjie Wang +1Instruction FollowingRubric-Based Evaluation

  19. SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

    May 7, 2026Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang +11LLM EvaluationRubric-Based Evaluation

  20. Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

    May 7, 2026Jessica Huynh, Alfredo Gomez, Athiya Deviyani +3Inter-Rater ReliabilityLLM-as-a-Judge

  21. Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

    May 3, 2026Christopher Kelly, Angelica Chowdhury, Alexandra Campili +5Human-in-the-Loop EvaluationRubric-Based Evaluation

  22. Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

    May 2, 2026Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge

  23. Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR

    Apr 30, 2026Sidi Chang, Peiying Zhu, Yuxiao Chen +1LLM EvaluationRubric-Based Evaluation

  24. Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics

    Apr 29, 2026Jatin Bhusal, Nancy Mahatha, Aayush Acharya +1LLM EvaluationEducational Assessment

  25. SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials

    Apr 28, 2026Zhaohui Li, Peng He, Zhiyuan Chen +4LLM EvaluationAI in Education

  26. Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks

    Apr 27, 2026Lawrence Keunho Jang, Jing Yu Koh, Daniel Fried +1Computer-Use Agent BenchmarksWeb Agent Benchmarks

  27. Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

    Apr 27, 2026Aaryan Shah, Andrew Hines, Alexia Downs +6LLM-as-a-JudgeHuman-AI Agreement