Rubric-Based Evaluation

Momentum

18 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 136

All topics
CardsList
  1. REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading

    Apr 24, 2026Chengshuai Zhao, Fan Zhang, Kumar Satvik Chaudhary +4Concept Bottleneck ModelsAutomated Essay Scoring

  2. Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews

    Apr 21, 2026Bowen Li, Haochen Ma, Yuxin Wang +5LLM EvaluationRubric-Based Evaluation

  3. TactileEval: A Step Towards Automated Fine-Grained Evaluation and Editing of Tactile Graphics

    Apr 20, 2026Adnan Khan, Abbas Akkasi, Majid KomeiliRubric-Based EvaluationAutomated Evaluation

  4. From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

    Apr 18, 2026Ivo Bueno, Babette Bühler, Philipp Stark +5Educational AssessmentShapley Value Attribution

  5. The Hitchhikers Guide to Rubric Quality Understanding and Enrichment

    Apr 1, 2026Ankit Aich, Zhengyang Qi, Charles Dickens +7Agent EvaluationPsychometric Validation

  6. MASRubric: Auditing Information Flow in Multi-Agent Systems with Failure-Distilled Pitfall Rubrics

    Feb 26, 2026Yutong Wang, Siyuan Xiong, Xuebo Liu +4Agent Failure AnalysisMulti-Agent Systems

  7. Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

    Feb 14, 2026Ruomeng Ding, Yifei Pang, He Sun +3LLM AlignmentLLM-as-a-Judge

  8. JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

    Feb 6, 2026Lanbo Lin, Jiayao Liu, Tianyuan Yang +5LLM-as-a-JudgeAI Agent Evaluation

  9. CoReflect: A Reflective Co-Evolution Framework for Improving Conversational Evaluation

    Jan 18, 2026Yunzhe Li, Richie Yueqi Feng, Tianxin Wei +1Rubric-Based EvaluationAutomated Evaluation

  10. From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

    Jan 13, 2026Yihan Hong, Huaiyuan Yao, Bolin Shen +3LLM-as-a-JudgeRubric-Based Evaluation

  11. Expert Preference-based Evaluation of Automated Related Work Generation

    Aug 11, 2025Furkan Şahinuç, Subhabrata Dutta, Iryna GurevychHuman Preference EvaluationLLM-as-a-Judge

  12. A Course Intelligence Platform for Higher Education: Lessons from AI-Assisted Course Evaluation

    Nov 3, 2024Bo Yuan, Jiazi Hu, Haimei ZhaoEducational AssessmentGenerative AI in Education

  13. DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Reports

    Date pendingRuizhe Li, Mingxuan Du, Benfeng Xu +3Deep Research AgentsLLM Agent Evaluation