Rubric-Based Evaluation

Momentum

18 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 136

All topics
CardsList
  1. Alice: A Large-Scale German Benchmark for Rubric-Based Multi-Dimensional Automatic Short Answer Scoring

    Oct 7, 2026Zhifan Sun, Sebastian Gombert, Jannik Lossjew +6Automated GradingEducational Assessment

  2. Rubric Spans are Label Representations: Joint LLM Encoding for Short Answer Scoring

    Oct 7, 2026Zhifan Sun, Sebastian Gombert, Fabian Zehner +3Automated GradingRubric-Based Evaluation

  3. RubricArmor: Adversarial Evolution Improves LLM-Based Rubric Generation

    Oct 4, 2026Haocheng Yang, Yuchao Zhang, Licheng Pan +8Reward HackingRubric-Based RL

  4. MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

    Sep 30, 2026Zihan Shen, Qi Liu, Zixuan Yang +4Open-Ended GenerationReward Modeling

  5. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoClinical ReasoningRubric-Based Evaluation

  6. Mubric: Mutation Testing-Guided Rubric Generation for LLM Evaluation

    Sep 29, 2026Jiayuxuan Yang, Jie M. Zhang, Yiling Lou +1Language Model Generation EvaluationRubric-Based Evaluation

  7. FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents

    Sep 28, 2026Hoyoung Lee, Suyeol Yun, Jack Haverty +17LLM Agent EvaluationRubric-Based Evaluation

  8. SkillRubric: Co-Evolving Actor Guidance and Evaluator Rubrics for Multimodal Agents

    Sep 28, 2026Bingqing Jiang, Guoxi Zhang, Jasper Wang +7Multimodal Reward ModelingRubric-Based RL

  9. RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

    Sep 19, 2026Zhenchen Tang, Yang Li, Songlin Yang +6Reward ModelingMultimodal Reward Modeling

  10. ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals

    Sep 15, 2026Bowen Qin, Yi Xie, Yesheng Liu +1Reward HackingLanguage Model Generation Evaluation

  11. Don't Count the Edits, Judge by the Outcome Alone: Reward-Based Evaluation for Grammatical Error Correction

    Sep 14, 2026Hayeong Ryu, Sunhee Jo, Seunguk Yu +1Reward ModelingReference-Free Evaluation

  12. Rubric-Aligned Disentangled Evaluation of Human Simultaneous Interpreting

    Sep 11, 2026Ziyu Zhang, Satoshi NakamuraRubric-Based EvaluationAutomated Evaluation

  13. Efficient Test-Time Adaptation through Human-AI Interaction

    Sep 3, 2026Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao +22Test-Time AdaptationRubric-Based Evaluation

  14. PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

    Sep 2, 2026Fan Yuxuan, Huang Miaojun, Zhang Haimei +2Automated EvaluationRubric-Based Evaluation

  15. Towards a Reliable and Practical Eval Pipeline

    Sep 1, 2026Emma Thuong Nguyen, Abhishek GhoseLLM EvaluationLLM-as-a-Judge

  16. PaperGym: Rubric-Centered Evolution for Research-Plan Generation

    Aug 31, 2026Yuhan Wang, Zhengxi Lu, Yuchen Yan +6AI Agents for Scientific DiscoveryRubric-Based RL

  17. Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

    Aug 31, 2026Xuehai Wang, Haowei Qin, Tongxin Liu +6AI Agent EvaluationAutonomous Scientific Discovery

  18. Small Language Models as Judges for Rubric-Based Reinforcement Learning

    Aug 30, 2026Fengyu Xie, Yilun Zhao, Bingsen Chen +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  19. GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

    Aug 30, 2026Yifan Chen, Haitao Li, Qingyao Ai +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  20. ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

    Aug 23, 2026Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. AgichteinLLM EvaluationRubric-Based Evaluation

  21. Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

    Aug 12, 2026Minglai Yang, Xinyu Guo, Utkarsh Tyagi +6Reward HackingRubric-Based RL

  22. RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement

    Aug 10, 2026Ziheng Jia, Jiaying Qian, Zicheng Zhang +3LLM-as-a-JudgeRubric-Based Evaluation

  23. AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

    Aug 5, 2026Jinting Wang, Yuguang Yang, Shengyu Li +4Text-to-Audio GenerationRubric-Based Evaluation

  24. FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation

    Aug 5, 2026Yinghao Tang, Tan Zhenwei, Yiyao Wang +4Financial ServicesLLM Evaluation

  25. RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

    Aug 3, 2026Divyansh Singh, Reza Davari, Afra MashhadiLLM-as-a-JudgeLLM Auditing

  26. Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

    Aug 3, 2026Baicheng Lin, Lingxi Jin, Kyung-Seok MinLLM-as-a-JudgeEducational Technology

  27. AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment

    Aug 1, 2026Garv Vikram Gursahaney, Baskhad Idrisov, Thorsten Fröhlich +1Rubric-Based EvaluationAutomated Grading

  28. CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

    Jul 31, 2026Mengting Chen, Yanshu Sun, Wanting Liang +5Open-Ended GenerationLLM Evaluation

  29. An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

    Jul 30, 2026Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler +1LLM EvaluationPolicy Evaluation

  30. Co-Evolving LLM Evaluators and Policies via DynamicRubric

    Jul 22, 2026Beining Wang, Weihang Su, Hongtao Tian +8RL for Language ModelsLLM Evaluation

  31. Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

    Jul 22, 2026Kailin Jiang, Lei Liu, Jian Xi +7Learning to RankRubric-Based Evaluation

  32. Assessment in Team Problem-Solving Exercises in Computing Education

    Jul 21, 2026Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk +3Educational AssessmentRubric-Based Evaluation

  33. EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

    Jul 20, 2026Jia-Kai Dong, Yi-Cheng Lin, Hung-yi LeeLLM-as-a-JudgeEducational Assessment

  34. AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

    Jul 17, 2026Ming Chen, Pranav PaiMulti-Agent SystemsRubric-Based Evaluation

  35. Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence

    Jul 16, 2026Haocheng Yang, Licheng Pan, Yuan Lu +7Rubric-Based Evaluation

  36. Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

    Jul 16, 2026Leanne Tan, Rohan Jaggi, Shaun Khoo +1Human-in-the-Loop EvaluationRubric-Based Evaluation

  37. When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

    Jul 15, 2026Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang +7Educational AssessmentAutomated Essay Scoring

  38. Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

    Jul 14, 2026Hanhua Hong, Yizhi Li, Jiaoyan Chen +4LLM EvaluationRubric-Based Evaluation

  39. Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

    Jul 14, 2026Xing Zhang, Guanghui Wang, Yanwei Cui +4LLM Agent EvaluationLLM Agent Self-Improvement

  40. Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

    Jul 9, 2026Ethan Leung, Elias Lumer, Corey Feld +3LLM-as-a-JudgeCitation Verification

  41. Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

    Jul 2, 2026Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard +2LLM-as-a-JudgeComputer Science Education