Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. SCOPE-RL: Optimizing Reasoning Paths Before and After Success

    Jul 13, 2026Xiaojian Liu, Han Xu, Jianqiang Xia +6Reward ShapingRL for Language Model Reasoning

  2. SETA: Scaling Environments for Terminal Agents

    Jul 12, 2026Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru +19Reinforcement LearningTerminal Agents

  3. Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

    Jul 11, 2026Pengfei Cai, Utkarsh Utkarsh, Alan Edelman +2RL for Code GenerationScientific Code Generation

  4. Multimodal Reward Hacking in Reinforcement Learning

    Jul 10, 2026Jiayu Yao, Yiwei Wang, Anmeng Zhang +5Multimodal Large Language ModelsMultimodal Reward Modeling

  5. RLVP: Penalize the Path, Reward the Outcome

    Jul 8, 2026Bojie Li, Noah ShiAgentic RLConstrained RL

  6. Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

    Jul 7, 2026Akshay Arora, Ishan Nigam, Ashutosh Aggarwal +6Agentic RLAI Agent Evaluation

  7. Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation

    Jul 6, 2026Muhammad Zain Amin, Kibele Sebnem YildirimReinforcement LearningRL for Language Model Reasoning

  8. Weak-to-Strong Generalization via Direct On-Policy Distillation

    Jul 6, 2026Shiyuan Feng, Huan-ang Gao, Haohan Chi +7RL for Language Model ReasoningWeak-to-Strong Generalization

  9. Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

    Jul 6, 2026Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning

  10. World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

    Jul 1, 2026Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan +1LLM Agent EvaluationAI Agent Benchmarks

  11. Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

    Jun 30, 2026Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu +1Low-Rank AdaptationReinforcement Learning with Verifiable Rewards

  12. Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index

    Jun 30, 2026Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang +5Reinforcement LearningRL for Language Model Reasoning

  13. Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning

    Jun 30, 2026Xiangli Shi, Xiaomeng Zhu, Ye Tian +5Large Language Model-Based Robot PlanningSymbolic Planning

  14. Experience Augmented Policy Optimization for LLM Reasoning

    Jun 29, 2026Jinda Lu, Kexin Huang, Junkang Wu +7Reinforcement LearningRL for Language Model Reasoning

  15. LatentRevise: Learning from Zero-Hit Reasoning

    Jun 29, 2026Yiqiu Guo, Xueting Han, Qi Jia +2RL for Language Model ReasoningMathematical Reasoning

  16. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement LearningRL for Language Model Reasoning

  17. Tandem Reinforcement Learning with Verifiable Rewards

    Jun 26, 2026Difan Jiao, Raghav Singhal, Robert West +1Reinforcement LearningRL for Language Model Reasoning

  18. PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction

    Jun 26, 2026Dongxia Wu, Mingyu Li, Yuhui Zhang +4Single-Cell Perturbation ModelingReinforcement Learning with Verifiable Rewards

  19. Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

    Jun 25, 2026Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang +6RL for Code GenerationReinforcement Learning

  20. RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

    Jun 25, 2026Rongjian Chen, Jianmin Hu, Kejiang Ye +1Reinforcement LearningRL for Language Model Reasoning

  21. The Verification Horizon: No Silver Bullet for Coding Agent Rewards

    Jun 24, 2026Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Reward ModelingReward Hacking