Rubrics

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 60

All topics
CardsList
  1. RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

    Oct 1, 2026Jingtan Wang, Sirajul Salekin, Young mok Jung +3Mixture-Of-AgentsReward Functions

  2. Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics

    Sep 30, 2026Maoqi Liu, Junwei He, Bowen Zhang +5RubricsScoring

  3. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoRubricsTask-Specific Rubrics

  4. Mubric: Mutation Testing-Guided Rubric Generation for LLM Evaluation

    Sep 29, 2026Jiayuxuan Yang, Jie M. Zhang, Yiling Lou +1RubricsLarge Language Model Evaluation

  5. SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety

    Sep 28, 2026Jianxing Chen, Xiao Yu, Shipra Agrawal +1Safety BenchmarksSecurity Evaluation

  6. FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents

    Sep 28, 2026Hoyoung Lee, Suyeol Yun, Jack Haverty +17Finance BenchmarksTask-Specific Rubrics

  7. Rubric Rewards from Item Response Theory

    Sep 28, 2026Milad Yazdani, Yaser Souri, Xiren Zhou +4RubricsItem Response Theory

  8. SkillRubric: Co-Evolving Actor Guidance and Evaluator Rubrics for Multimodal Agents

    Sep 28, 2026Bingqing Jiang, Guoxi Zhang, Jasper Wang +7Multimodal AgentsTask-Specific Rubrics

  9. Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It

    Sep 22, 2026Yu Sun, Junhao Xu, Jiajia Shi +1DecisionsChoice

  10. ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals

    Sep 15, 2026Bowen Qin, Yi Xie, Yesheng Liu +1RubricsImpossibility

  11. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio UnderstandingLarge Audio Language Models

  12. PaperGym: Rubric-Centered Evolution for Research-Plan Generation

    Aug 31, 2026Yuhan Wang, Zhengxi Lu, Yuchen Yan +6Research AutomationRubrics

  13. Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

    Aug 31, 2026Xuehai Wang, Haowei Qin, Tongxin Liu +6Research AutomationRubrics

  14. GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

    Aug 30, 2026Yifan Chen, Haitao Li, Qingyao Ai +4RubricsLarge Language Model Evaluation

  15. Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

    Aug 12, 2026Minglai Yang, Xinyu Guo, Utkarsh Tyagi +6Task-Specific RubricsRubrics

  16. PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis

    Aug 5, 2026Xiaomin He, Dongling Xiao, Jiahao Xie +4RubricsPrism

  17. Training Documents Reranker with Search Rubrics for Deep Research Agent

    Aug 4, 2026Wenhan Liu, Yu Lu, Qiaolin Xia +8Cross-Encoder RerankingDeep Research

  18. Rubrics as Privileged Information for Open-Ended Generation

    Aug 3, 2026Deepika Bablani, Ajay Gupta, Wanming ChenRubricsReward Functions

  19. CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

    Jul 31, 2026Mengting Chen, Yanshu Sun, Wanting Liang +5Task-Specific RubricsRubrics

  20. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Jul 30, 2026Yuhang Zhu, Mingxuan Du, Benfeng Xu +3Role-Playing AgentsUser Simulation

  21. Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence

    Jul 16, 2026Haocheng Yang, Licheng Pan, Yuan Lu +7RubricsTask-Specific Rubrics

  22. Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

    Jul 16, 2026Leanne Tan, Rohan Jaggi, Shaun Khoo +1Artificial Intelligence EvaluationRubrics

  23. When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

    Jul 15, 2026Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang +7Automated Essay ScoringTask-Specific Rubrics

  24. Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

    Jul 14, 2026Hanhua Hong, Yizhi Li, Jiaoyan Chen +4Rubrics

  25. RUBRIC: Realism--Utility Balanced Ranking for Imbalanced Classification

    Jul 10, 2026Yanxuan Yu, Dong liu, Renata Borovica-Gajic +1Imbalanced ClassificationClass Imbalance

  26. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

    Jul 5, 2026Yujin Kim, Namgyu Ho, Sangmin Hwang +7Reinforcement Learning With Verifiable RewardTutors

  27. SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    Jul 2, 2026Jiayin Zhu, Kelong Mao, Yudong Guo +4SkillsRubrics

  28. Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

    Jun 29, 2026Yangda Peng, Yunjia Qi, Haotian Xia +8Rubric-Based ScoringLlm-As-A-Judge

  29. Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

    Jun 19, 2026Weilu Xu, Yunzhi Shen, Xinye Wang +2Machine Translation QualityRubrics

  30. LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

    Jun 16, 2026Xiwei Xu, Chen Wang, Jacky Jiang +5Llm-As-A-JudgeCurriculum

  31. DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

    Jun 11, 2026Jingxuan Han, Wei Liu, Mingyang Zhu +8Search AgentsAgentic Benchmarks

  32. From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

    Jun 7, 2026Hao Chen, Ziyu Han, Yukun Yan +3RubricsLarge Language Model Evaluation

  33. Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics

    Jun 6, 2026Mengyuan Sun, Yu Li, Zhuohao Yu +2RubricsTask-Specific Rubrics

  34. Using Large Language Models to Support High Volume Application Review for an Undergraduate Research Program

    Jun 4, 2026Varun Aggarwal, Kay Kobak, John HowarterRubrics

  35. QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

    Jun 2, 2026Rongzhi Zhang, Rui Feng, Zhihan Zhang +8Reinforcement Learning With Verifiable RewardRubrics

  36. Deep Research as Rubric for Reinforcement Learning

    May 31, 2026Wangyi Mei, Zhouhong Gu, Zhenhan Bai +9RubricsDeep Research

  37. Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge

    May 28, 2026Zijie Wang, Eduardo BlancoRubricsLlm-As-A-Judge

  38. MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

    May 28, 2026Haowen Wang, Yaxin Du, Jian Yang +9Alignment-Aware SelectionTraining Data

  39. Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

    May 28, 2026Yun Wang, Xin Xia, Xuansheng Wu +2Rubric-Based ScoringTask-Specific Rubrics

  40. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9RubricsOffline Reinforcement Learning

  41. Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

    May 22, 2026Jiazheng Kang, Bowen Zhang, Zixin Song +4Search AgentsAgentic Reasoning

  42. Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

    May 22, 2026Sirui Chen, Lei Xu, Yuying Zhao +6LLM Reasoning StrategiesMetacognition

  43. LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

    May 19, 2026Shanshan Xu, Johan Lindholm, Amogh Raina +2Legal Reasoning TasksLegal Domain

  44. Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

    May 19, 2026Grandee Lee, Yue Wang, Che Yee Lye +1Computerized Adaptive TestingRubrics

  45. Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs

    May 18, 2026Jacob Levine, Miguel Aenlle, Craig Zilles +2GradingHandwriting

  46. Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

    May 7, 2026Jessica Huynh, Alfredo Gomez, Athiya Deviyani +3RubricsInter-Annotator Agreement

  47. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8Large Language Model EvaluationTask-Specific Rubrics

  48. The Hitchhikers Guide to Rubric Quality Understanding and Enrichment

    Apr 1, 2026Ankit Aich, Zhengyang Qi, Charles Dickens +7Rubric-Based ScoringRubrics

  49. MASRubric: Auditing Information Flow in Multi-Agent Systems with Failure-Distilled Pitfall Rubrics

    Feb 26, 2026Yutong Wang, Siyuan Xiong, Xuebo Liu +4Model-Based Multi-Agent SystemsModel Auditing

  50. Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

    Feb 14, 2026Ruomeng Ding, Yifei Pang, He Sun +3RubricsJudges

  51. From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

    Jan 13, 2026Yihan Hong, Huaiyuan Yao, Bolin Shen +3Rubric-Based ScoringRubrics

  52. DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Reports

    Date pendingRuizhe Li, Mingxuan Du, Benfeng Xu +3Deep ResearchRubrics