Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

    May 14, 2026Mengjie Ren, Jie Lou, Boxi Cao +6RL for Code GenerationLLM Self-Correction

  2. PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

    May 13, 2026Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong +6VLM ReasoningReinforcement Learning with Verifiable Rewards

  3. Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

    May 13, 2026Feng Zhang, Xinhong Ma, Ziqiang Dong +5RL for Language Model ReasoningGroup Relative Policy Optimization

  4. Multi-Rollout On-Policy Distillation via Peer Successes and Failures

    May 12, 2026Weichen Yu, Xiaomin Li, Yizhou Zhao +8RL for Language Model ReasoningLanguage Model Distillation

  5. Reward Hacking in Rubric-Based Reinforcement Learning

    May 12, 2026Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3Reward HackingReinforcement Learning

  6. StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

    May 12, 2026Hao Wang, Rui Li, Lei Sha +1RL for Language Model ReasoningExecution-Guided Code Generation

  7. Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

    May 12, 2026Jiazheng Zhang, Ziche Fu, Junrui Shen +17RL for Language Model ReasoningPolicy Optimization

  8. CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

    May 12, 2026Jianghan Shen, Siqi Luo, Xinyu Cheng +6RL for Language ModelsReinforcement Learning

  9. Selective Off-Policy Reference Tuning with Plan Guidance

    May 12, 2026Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen +2Reinforcement LearningRL for Language Model Reasoning

  10. Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

    May 12, 2026Huimin Xu, Shuai Zhao, Xiaobao Wu +1Reinforcement LearningRL for Language Model Reasoning

  11. Verifiable Process Rewards for Agentic Reasoning

    May 11, 2026Huining Yuan, Zelai Xu, Huaijie Wang +6Process Reward ModelsCredit Assignment in RL

  12. Relative Score Policy Optimization for Diffusion Language Models

    May 11, 2026Zichao Yu, Shengze Xu, Bingqing Jiang +2RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  13. BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

    May 9, 2026Yuanhao Li, Hongbo Wang, Xiaotang Shang +3Automated Program RepairProcess Reward Models

  14. Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

    May 9, 2026Xiaozhe Li, Xinyu Fang, Shengyuan Ding +5RL BenchmarksReinforcement Learning

  15. How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

    May 9, 2026Yifan Xu, Junren Chen, Yifan ChenRL for Language Model ReasoningPrompt Tuning

  16. Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

    May 9, 2026Minzheng Wang, Run Luo, Yanbo Wang +6Reinforcement LearningSelf-Play RL

  17. The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

    May 9, 2026Tianhao Cheng, Zeyu Huang, Zihan Qiu +5Reinforcement LearningToken-Level Credit Assignment

  18. DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

    May 8, 2026Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu +1Reinforcement LearningGroup Relative Policy Optimization

  19. AIPO: Learning to Reason from Active Interaction

    May 8, 2026Junnan Liu, Linhao Luo, Thuy-Trang Vu +1RL for Language Model ReasoningLLM-Guided RL

  20. Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

    May 8, 2026Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe +2Reinforcement LearningRL for Language Model Reasoning

  21. Interactive Critique-Revision Training for Reliable Structured LLM Generation

    May 8, 2026Fei Xu Yu, Zuyuan Zhang, Mahdi Imani +2LLM Self-RefinementGroup Relative Policy Optimization