Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

    Jul 31, 2026Yifan Ding, Xincheng Wei, Yoshua Y. Li +7RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  2. Group-Reflective Self-Distillation for Agentic Reinforcement Learning

    Jul 30, 2026Binbin Zheng, Zijun Xie, Guanqun Zhao +4Agentic RLCredit Assignment in RL

  3. Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning

    Jul 30, 2026Efstratios Zaradoukas, Davide Gabrielli, Bardh Prenkaj +1Reinforcement Learning with Verifiable RewardsMachine Unlearning

  4. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Jul 30, 2026Qiangqiang He, Zhongheng Wu, ZiJian WangToken-Level Credit AssignmentRL for Language Model Reasoning

  5. Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

    Jul 29, 2026Yikun Li, Ting Zhang, Jiakun Liu +9Agentic RLSoftware Vulnerability Detection

  6. Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

    Jul 28, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement LearningRL for Language Model Reasoning

  7. Reinforcement Learning for Code Optimization

    Jul 28, 2026Pierre Chambon, Kunhao Zheng, Juliette Decugis +2RL for Code GenerationReinforcement Learning

  8. CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    Jul 28, 2026Yu Wang, Yi-Kai Zhang, Wentao Shi +8Reinforcement LearningGame-Playing Agents

  9. EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

    Jul 27, 2026Xiao Ma, Zhiquan Hu, Yi Wei +5Reinforcement LearningAgentic RAG

  10. From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

    Jul 26, 2026Qinsi Wang, Jing Shi, Huazheng Wang +8Self-Play RLReinforcement Learning with Verifiable Rewards

  11. AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning

    Jul 23, 2026Zibin Meng, Zhenyu Zhao, Chunqiang RunKnowledge Augmentation for Language ModelsRL for Language Model Reasoning

  12. From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python

    Jul 23, 2026Muntasir Adnan, Manile Srun, Carlos C. N. KuhnSoftware Vulnerability DetectionLLMs for Cybersecurity

  13. Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

    Jul 23, 2026Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali JannesariRL for Code GenerationGPU Kernel Optimization

  14. Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

    Jul 22, 2026Md Tanvirul AlamSynthetic Data GenerationVLM Reasoning

  15. SLPO: Scaling Latent Reasoning via a Surrogate Policy

    Jul 22, 2026Runyang You, Zhiyuan Liu, Yongqi Li +1Reinforcement LearningRL for Language Model Reasoning

  16. ISO: An RLVR-Native Optimization Stack

    Jul 21, 2026Hanqing Zhu, Wenyan Cong, Zhizhou Sha +8Reinforcement Learning with Verifiable RewardsRL Post-Training

  17. Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

    Jul 21, 2026Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou +4Reinforcement LearningRL for Language Model Reasoning

  18. The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

    Jul 21, 2026Michael Jungo, Aixiu AnRL for Language ModelsRL for Language Model Reasoning

  19. H2^2SD: Hybrid Hindsight Self-Distillation

    Jul 21, 2026Qiye Cai, Yichuan Ma, Peiji Li +6RL for Language Model ReasoningLanguage Model Distillation

  20. Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

    Jul 16, 2026Weiwen Xu, Jia Liu, Hou Pong Chan +4RL for Language Model ReasoningPolicy Optimization

  21. SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

    Jul 15, 2026Cheng Tang, Junzhi Ning, Min Cen +9Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  22. Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

    Jul 14, 2026Takumi Shioda, Kohei Terashima, Tatsuo NagaiRL for Language Model ReasoningBuilding Energy Management

  23. Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

    Jul 14, 2026Xinyu Tang, Qianggang Cao, Yurou Liu +13RL for Language ModelsRL for Language Model Reasoning