Rubric-Based RL

RL: Reinforcement Learning

Momentum

19 papers in the last four weeks, up 58% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 68

All topics
CardsList
  1. ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering

    Aug 11, 2026Taojie Zhu, Yuan Xia, Tao Sun +8Rubric-Based RLMedical QA

  2. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

    Aug 10, 2026Jinkun Hou, Zhuo Liu, Huimin Ren +3Open-Ended GenerationRL for Language Models

  3. Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

    Aug 3, 2026Fangxu Yu, Tao Feng, Dehai Min +6Audio ReasoningRubric-Based RL

  4. SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

    Jul 29, 2026Jianze Wang, Kunwang Zheng, Ying Liu +5Reinforcement LearningTest-Time RL

  5. CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

    Jul 28, 2026Bo-Wen Zhang, Junwei He, Wen Wang +5Token-Level Credit AssignmentRubric-Based RL

  6. Co-Evolving LLM Evaluators and Policies via DynamicRubric

    Jul 22, 2026Beining Wang, Weihang Su, Hongtao Tian +8RL for Language ModelsLLM Evaluation

  7. Rewarding Better Thinking for LLM Preference Alignment

    Jul 22, 2026Xubo Liu, Wenya Guo, Ruxue Yan +2Process Reward ModelsCredit Assignment in RL

  8. LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

    Jul 20, 2026Tianzhu Ye, Li Dong, Guanheng Chen +4Reinforcement LearningRubric-Based RL

  9. CriPO: Enhancing Rubric-based RL via Self-Distillation

    Jul 20, 2026Mingxuan Xia, Yuhang Yang, Chao Ye +7Credit Assignment in RLRubric-Based RL

  10. Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

    Jul 6, 2026Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning

  11. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

    Jul 5, 2026Yujin Kim, Namgyu Ho, Sangmin Hwang +7RL for Language ModelsReinforcement Learning

  12. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

    Jun 22, 2026Hongxin Ding, Baixiang Huang, Yue Fang +6RL for Language ModelsRubric-Based RL

  13. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

    Jun 19, 2026Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL

  14. DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

    Jun 15, 2026Minghang Zhu, Chuyang Wei, Junhao Xu +3Deep Research AgentsRubric-Based RL

  15. ExpRL: Exploratory RL for LLM Mid-Training

    Jun 15, 2026Violet Xiang, Amrith Setlur, Chase Blagden +2Reinforcement LearningRL for Language Model Reasoning

  16. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1LLM-as-a-JudgeRubric-Based RL

  17. Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

    Jun 3, 2026Xuekang Wang, Zhuoyuan Hao, Shuo Hou +3Reward HackingRL for Language Models

  18. QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

    Jun 2, 2026Rongzhi Zhang, Rui Feng, Zhihan Zhang +8Reinforcement LearningRL for Language Model Reasoning

  19. Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

    Jun 2, 2026Can Lv, Mingju Chen, Heng Chang +1Reward ModelingRL for Language Models

  20. RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

    Jun 2, 2026Xian Qi Loye, Qinglin Su, Zhexin Zhang +5Reinforcement LearningAI Agent Safety

  21. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models

  22. Deep Research as Rubric for Reinforcement Learning

    May 31, 2026Wangyi Mei, Zhouhong Gu, Zhenhan Bai +9Open-Ended GenerationReinforcement Learning

  23. Reinforcement Learning with Robust Rubric Rewards

    May 28, 2026Ya-Qi Yu, Hao Wang, Fangyu Hong +15Reinforcement LearningRubric-Based RL

  24. EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

    May 28, 2026Xin Guan, Xiaomeng Hu, Shen Huang +6Open-Ended GenerationRL for Language Models

  25. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  26. Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

    May 26, 2026Zixuan Yang, Yiqun Chen, Wei Yang +7Open-Ended GenerationReward Modeling

  27. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9Multi-Objective Reinforcement LearningRL for Language Models

  28. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning