Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Verifiable Environments Are LEGO Bricks: Recursive Composition for Reasoning Generalization

    Jun 10, 2026Hao Xiang, Qiaoyu Tang, Le Yu +8RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  2. SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

    Jun 10, 2026Chao Lei, Yanbei Jiang, Markus Hiller +4Visual Spatial ReasoningReinforcement Learning with Verifiable Rewards

  3. Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

    Jun 9, 2026João Coelho, João Magalhães, Bruno Martins +1Reinforcement LearningGroup Relative Policy Optimization

  4. CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

    Jun 8, 2026Penghui Yang, Long Xing, Xiaoyi Dong +10Image CaptioningMultimodal Pretraining

  5. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  6. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1LLM-as-a-JudgeRubric-Based RL

  7. sGPO: Trading Inference FLOPs for Training Efficiency in RLVR

    Jun 7, 2026Shivchander Sudalairaj, Kai Xu, Akash Srivastava +1Group Relative Policy OptimizationAdaptive Sampling

  8. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

    Jun 7, 2026Hao Chen, Zhanming Shen, Liyao Li +8Intrinsic Reward MethodsReinforcement Learning

  9. Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

    Jun 7, 2026Hongwei Wang, Miao Zhou, Fengde Wang +10RL for Language ModelsVessel Trajectory Prediction

  10. PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

    Jun 7, 2026Shumeng Yang, Yisu Liu, Jiayi Zheng +2RL for Language Model ReasoningMaximum Entropy RL

  11. Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

    Jun 7, 2026Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun +7RL for Language Model ReasoningSparse Attention

  12. CATPO: Critique-Augmented Tree Policy Optimization

    Jun 6, 2026Ayush Singh, Umang Goyal, Ankur DahiyaRL for Language ModelsReinforcement Learning

  13. ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning

    Jun 6, 2026Qing Miao, Yiming Zhao, Jing Yang +5Reward ShapingRL for Language Model Reasoning

  14. DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

    Jun 6, 2026Hangui Lin, Yan Shu, Zhengyang Liang +8Cross-Modal AlignmentVLM Reasoning

  15. The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

    Jun 6, 2026Zhanke Zhou, Xiangyu Lu, Chentao Cao +4RL for Language Model ReasoningPolicy Optimization

  16. Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

    Jun 5, 2026Shizhe Xiang, Ke An, Wenlong Yu +4Large Vision-Language ModelsMultimodal Reasoning

  17. TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

    Jun 4, 2026Eric Spencer, Arslan Bisharat, Brian Ortiz +6LLM-Based Program SynthesisFormal Verification

  18. MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

    Jun 4, 2026Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili +1Group Relative Policy OptimizationInstruction Following

  19. SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter

    Jun 4, 2026Powei Chang, Jinpeng Zhang, Chaoqun Sun +6Policy GradientGroup Relative Policy Optimization

  20. Reinforcement Learning from Rich Feedback with Distributional DAgger

    Jun 3, 2026Rishabh Agrawal, Jacob Fein-Ashley, Paria RashidinejadDistributional RLRL for Language Model Reasoning

  21. GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

    Jun 3, 2026Tej Deep Pala, Vernon Toh, Soujanya PoriaRL for Language Model ReasoningCredit Assignment in RL

  22. SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

    Jun 3, 2026Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang +7Process Reward ModelsScientific Reasoning

  23. Rollout-Level Advantage-Prioritized Experience Replay for GRPO

    Jun 3, 2026Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang +2RL for Language Model ReasoningGroup Relative Policy Optimization