Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation

    Sep 29, 2026Zhenrui Yue, Huimin Zeng, Yueqi Wang +8RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  2. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Reinforcement LearningProcess Reward Models

  3. Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

    Sep 29, 2026Zhongan Bi, Kepeng Lin, Xuanang Gao +2Counterfactual Evaluation of VLMsCredit Assignment in RL

  4. StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

    Sep 28, 2026Ziyi Yin, Sangmin Woo, Kang Zhou +4Reward ShapingLong-Horizon Robotic Manipulation

  5. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning

  6. Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts

    Sep 28, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Compositional T2I GenerationRL for Image Generation

  7. ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning

    Sep 28, 2026Yihang Chen, Yuanhao Ban, Cho-Jui HsiehPolicy OptimizationReinforcement Learning with Verifiable Rewards

  8. PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents

    Sep 28, 2026Jiazhou Zhou, Hu Zhou, Yucheng Chen +3On-Policy Self-DistillationReinforcement Learning with Verifiable Rewards

  9. MaPP: A Unified Marginalized Posterior-Predictive Framework for Data-Efficient RLVR

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Sheng Xu +4Bayesian RLRL for Language Model Reasoning

  10. Beyond Verbalized Confidence: Calibrating Reasoners with Differentiable Readouts

    Sep 28, 2026Chenxiao Fan, Chongming Gao, Gangyi Zhang +8Confidence Estimation in Language ModelsRL for Language Model Reasoning

  11. When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation

    Sep 28, 2026Xinke Jiang, Tao Feng, Zhibang Yang +4Gradient InterferenceReinforcement Learning with Verifiable Rewards

  12. Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents

    Sep 27, 2026Yuanhao Li, Hongbo Wang, Xuhong Chen +2RL for Code GenerationSoftware Engineering Agents

  13. Audit-First VAPO: Risk-Certified Selective Updates under Imperfect Verification

    Sep 27, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Algorithmic AuditingReinforcement Learning with Verifiable Rewards

  14. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4RL for Language ModelsRL for Language Model Reasoning

  15. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Reward ModelingLLM Reliability

  16. Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

    Sep 27, 2026Mingju Chen, Can Lv, Jinrong Liu +3Credit Assignment in RLReinforcement Learning with Verifiable Rewards

  17. EAGER: Enhancing Generative Event Extraction via Reinforcement Learning with Verifiable Rewards

    Sep 24, 2026Omar Adjali, Siting Liang, Omair Shahzad Bhatti +1RL for Language ModelsDocument Information Extraction

  18. Reinforcement Learning with Verifiable Rewards for Small Search Agents

    Sep 23, 2026Gaurisankar Jayadas, Aske Plaat, Álvaro Serra-Gómez +1Reinforcement LearningReinforcement Learning with Verifiable Rewards

  19. RLVR landscapes for iterated multiplications can be benign: Insights from spin-glass theory

    Sep 23, 2026Noa Rubin, Zohar RingelReinforcement LearningMaximum Entropy RL

  20. ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

    Sep 23, 2026Ming Ma, Yi Zhu, Yiran Zhong +7Agentic RLCredit Assignment in RL

  21. Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

    Sep 23, 2026Xinjie Shen, Wei Fan, Xudong Guo +5Agentic RLReinforcement Learning

  22. Video-HopChain: Multi-Hop Questions and Confidence-Gated Exploration for Video Reasoning Models

    Sep 22, 2026Trung Nguyen Quang, Yuhao Dong, Shuo Sun +4Group Relative Policy OptimizationVideo Reasoning

  23. Monitorable Chart Reasoning Agents via Verifiable Process Rewards

    Sep 21, 2026Sanchit Sinha, Oana Frunza, Kashif Rasul +1AI Agent MonitoringReinforcement Learning with Verifiable Rewards

  24. Do Language Models Need Music Supervision? Verifiable Rewards for Multi-Constraint Symbolic Music Generation

    Sep 20, 2026Haoyue Liu, Xiaoying TangMusic Generation EvaluationControllable Music Generation

  25. RLVR2^{2}: Reinforcement Learning with Verifiable Rubric-based Ranking

    Sep 20, 2026Hao Li, Zhengkun Zhang, Gangqiang Hu +4Learning to RankRubric-Based RL