Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1Value Function EstimationToken-Level Credit Assignment

  2. You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

    May 20, 2026Zhepei Wei, Xinyu Zhu, Wei-Lin Chen +3RL for Language Model ReasoningLow-Rank Approximation

  3. DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

    May 20, 2026Kaiyi Zhang, Wei Wu, Yankai LinPolicy GradientToken-Level Credit Assignment

  4. How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

    May 20, 2026Richa Verma, Balaraman RavindranDirect Preference OptimizationRL for Language Model Reasoning

  5. Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

    May 20, 2026Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand +2RL for Code GenerationReinforcement Learning

  6. Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

    May 20, 2026Xixiang He, Qiyao Sun, Ao Cheng +5RL for Language Model ReasoningGroup Relative Policy Optimization

  7. PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

    May 20, 2026Yiqi Zhang, Fangzheng Jiao, Tian Tang +13LLM Inference EfficiencyLLM Serving

  8. Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

    May 19, 2026Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei +5Reward ModelingRubric-Based RL

  9. Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

    May 19, 2026Wenjie Tang, Minne Li, Sijie Huang +2Reinforcement LearningPartially Observable RL

  10. GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

    May 19, 2026Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi +1Self-Play RLGeospatial Reasoning

  11. GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

    May 19, 2026Minxuan Lv, Tiehua Mei, Tanlong Du +9Reinforcement LearningLong-Context Modeling

  12. CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

    May 19, 2026Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed +4Token-Level Credit AssignmentRL for Language Model Reasoning

  13. When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

    May 19, 2026Yuchun Miao, Sen Zhang, Yuqi Zhang +4RL for Language Model ReasoningPolicy Optimization

  14. Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

    May 19, 2026Chongyu Fan, Gaowen Liu, Mingyi Hong +2Muon OptimizerVision-Language-Action Models

  15. AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

    May 18, 2026Zhenlin Wei, Pu Jian, Yingzhuo Deng +6Token-Level Credit AssignmentRL for Language Model Reasoning

  16. Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains

    May 18, 2026Zhonghang Yuan, Zhefan Wang, Fang Hu +7RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  17. Leveraging Error Diversity in Group Rollouts for Reinforcement Learning

    May 17, 2026Wenpu Liu, Yuqi Xu, Weichu Xie +8Reward ShapingRL for Language Model Reasoning

  18. Step-wise Rubric Rewards for LLM Reasoning

    May 17, 2026Weichu Xie, Haozhe Zhao, Wenpu Liu +15Reward ModelingCredit Assignment in RL

  19. The Unlearnability Phenomenon in RLVR for Language Models

    May 16, 2026Yulin Chen, He He, Chen ZhaoReinforcement LearningRL for Language Model Reasoning

  20. PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

    May 16, 2026Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf +3Self-Play RLRL for Language Model Reasoning

  21. GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction

    May 15, 2026Liangyi Huang, Zichen Liu, Fei Shao +5KG ConstructionCyber Threat Intelligence

  22. Calibrating LLMs with Semantic-level Reward

    May 15, 2026Fengfei Yu, Ruijia Niu, Dongxia Wu +2Language Model CalibrationLLM Reliability

  23. Video Models Can Reason with Verifiable Rewards

    May 14, 2026Tinghui Zhu, Sheng Zhang, James Y. Huang +5Video Diffusion ModelsRL for Video Generation