Rubric-Based Evaluation

Momentum

18 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 136

All topics
CardsList
  1. A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

    Jul 2, 2026Samiha A. Ismail, Fan X. Chen, Ali MeraliClinical Decision-MakingClinical Reasoning

  2. SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    Jul 2, 2026Jiayin Zhu, Kelong Mao, Yudong Guo +4LLM Agent EvaluationLLM Agent Skill Learning

  3. Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

    Jul 2, 2026Dazhi Fu, Jiuding Yang, Yiwen Guo +1Reward ModelingLLM-as-a-Judge

  4. PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

    Jun 30, 2026Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar +6Computer-Use AgentsRubric-Based Evaluation

  5. Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

    Jun 29, 2026Yangda Peng, Yunjia Qi, Haotian Xia +8LLM-as-a-JudgeAI Agent Benchmarks

  6. PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

    Jun 26, 2026Yana Wei, Hongbo Peng, Yanlin Lai +14Rubric-Based EvaluationAutomated Evaluation

  7. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

    Jun 22, 2026Hongxin Ding, Baixiang Huang, Yue Fang +6RL for Language ModelsRubric-Based RL

  8. Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

    Jun 19, 2026Weilu Xu, Yunzhi Shen, Xinye Wang +2LLM EvaluationRubric-Based Evaluation

  9. RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

    Jun 16, 2026Weizhi Zhang, Zechen Li, Hamid Palangi +16AI Agent EvaluationHuman-in-the-Loop Evaluation

  10. LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

    Jun 16, 2026Xiwei Xu, Chen Wang, Jacky Jiang +5LLM-as-a-JudgeEducational Assessment

  11. LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

    Jun 8, 2026Yifan Chen, Haitao Li, Yiran Hu +6LLM EvaluationRubric-Based Evaluation

  12. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

    Jun 8, 2026Yongtaek Lim, Hyeji Choi, Minwoo KimLLM-as-a-JudgeLLM Safety Evaluation

  13. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1LLM-as-a-JudgeRubric-Based RL

  14. From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

    Jun 7, 2026Hao Chen, Ziyu Han, Yukun Yan +3LLM EvaluationRubric-Based Evaluation

  15. Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics

    Jun 6, 2026Mengyuan Sun, Yu Li, Zhuohao Yu +2Reward ModelingRubric-Based Evaluation

  16. DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios

    Jun 5, 2026Tongzhou Yu, Mingjia Li, Hong Qian +6Creativity AssessmentComputational Creativity

  17. EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

    Jun 4, 2026Zhihao Wu, Linhai Zhang, Taiyi Wang +4LLM-as-a-JudgeRubric-Based Evaluation

  18. Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

    Jun 4, 2026Tao Liu, Ye Lu, Ruohua Zhang +4LLM EvaluationLLM-as-a-Judge

  19. QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

    Jun 2, 2026Rongzhi Zhang, Rui Feng, Zhihan Zhang +8Reinforcement LearningRL for Language Model Reasoning

  20. BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

    Jun 2, 2026Alex Wang, Georg Meinhardt, Jacob Katz +4Benchmark DesignFinancial QA

  21. Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria

    Jun 2, 2026Kelsey Rainey, Jesse RobertsComputer Science EducationMulti-Task Learning

  22. AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

    Jun 2, 2026Sangwon Baek, Kyu Yeon Hur, Kyunga KimLLM-as-a-JudgeClinical Decision Support

  23. AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

    Jun 2, 2026Haitao Li, Tian Tan, Yuguang Yang +2Audio-Language Model EvaluationLLM-as-a-Judge

  24. LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

    Jun 1, 2026Aastha Sapkota, M. G. Sarwar MurshedLLM EvaluationLLM-as-a-Judge

  25. Preference-Aware Rubric Learning for Personalized Evaluation

    May 29, 2026Yilun Qiu, Xiaoyan Zhao, Yang Zhang +7LLM EvaluationLLM Alignment

  26. PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

    May 29, 2026Swastik Roy, Rajkumar Pujari, Tharindu Kumarage +5LLM-as-a-JudgeLLM Auditing

  27. Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge

    May 28, 2026Zijie Wang, Eduardo BlancoLLM-as-a-JudgeLanguage Model Generation Evaluation

  28. Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?

    May 28, 2026Kotaro Yoshida, So Kuroki, Yuki Imajuku +4Rubric-Based EvaluationAutomated Peer Review

  29. EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

    May 28, 2026Xin Guan, Xiaomeng Hu, Shen Huang +6Open-Ended GenerationRL for Language Models