Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

    May 8, 2026Yunho Choi, Jongwon Lim, Woojin Ahn +3Value Function EstimationRL for Language Model Reasoning

  2. HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control

    May 8, 2026Xincheng Yao, Ruoqi Li, Cheng Chen +4RL for Language ModelsExploration-Exploitation Tradeoff

  3. Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

    May 8, 2026Chen Wang, Hexuan Deng, Yining Zhang +5Overthinking in Language ModelsReinforcement Learning with Verifiable Rewards

  4. Structured Role-Aware Policy Optimization for Multimodal Reasoning

    May 8, 2026Bingqing Jiang, Difan ZouToken-Level Credit AssignmentMultimodal Reasoning

  5. Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents

    May 8, 2026Deeraj S K, Sadhana Devarajan, Krishna Mehra +1Emotion Recognition in ConversationsAdversarial Robustness of Language Models

  6. Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

    May 8, 2026Yash Ingle, Jaival Chauhan, Ankit Yadav +1Reinforcement LearningRL for Language Model Reasoning

  7. Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

    May 8, 2026Tao Wang, Shuo Li, Yan Sun +2RL for Language Model ReasoningGroup Relative Policy Optimization

  8. Verifier-Backed Hard Problem Generation for Mathematical Reasoning

    May 7, 2026Yuhang Lai, Jiazhan Feng, Yee Whye Teh +1Reinforcement Learning with Verifiable RewardsMulti-Agent LLMs

  9. On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

    May 7, 2026Hao Ye, Jisheng Dang, Junfeng Fang +7Reinforcement LearningReinforcement Learning with Verifiable Rewards

  10. Skip What You Can Predict: Predictive Repositioning for Policy Optimization for Efficient LLM Training

    May 7, 2026Ismam Nur Swapnil, Aranya Saha, Tasneea Zahra +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  11. Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

    May 7, 2026Yun Qu, Qi Wang, Yixiu Mao +11RL for Language Model ReasoningGroup Relative Policy Optimization

  12. Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

    May 7, 2026Chaoli Mou, Zhan Zhuang, Xinning Chen +1RL for Language Model ReasoningCredit Assignment in RL

  13. AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

    May 7, 2026Yang Xu, Kun Yao, Yiming Deng +3RL for Language Model ReasoningPolicy Optimization

  14. Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

    May 7, 2026Langlin Huang, Chengsong Huang, Jinyuan Li +3LLM PromptingRL for Language Model Reasoning

  15. SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

    May 7, 2026Hyobin Park, Taeseop Kim, Dong-Geol ChoiAI for ScienceSelf-Play RL

  16. EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance

    May 6, 2026Song Yu, Li Li, Wenwen Zhao +1RL for Language Model ReasoningGroup Relative Policy Optimization

  17. Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

    May 5, 2026Tianyang Han, Hengyu Shi, Junjie Hu +3RL for Code GenerationProcess Reward Models

  18. Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards

    May 3, 2026Rudray Dave, Vedang Dubey, Smit Deoghare +1Reinforcement LearningRL for Language Model Reasoning

  19. MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

    May 2, 2026Yin Zhang, Jiaxuan Zhao, Zonghan Wu +5Vision-Language ModelsReinforcement Learning

  20. Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation

    May 1, 2026Xin-Ye Li, Ren-Biao Liu, Yun-Ji Zhang +3RL for Code GenerationReinforcement Learning

  21. ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

    May 1, 2026Zihan Lin, Xiaohan Wang, Jie Cao +6RL for Language ModelsReinforcement Learning

  22. Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

    May 1, 2026Anamika Lochab, Bolian Li, Ruqi ZhangRL for Language Model ReasoningGroup Relative Policy Optimization

  23. Co-Evolving Policy Distillation

    Apr 29, 2026Naibin Gu, Chenxu Yang, Qingyi Si +7Reinforcement Learning with Verifiable RewardsMulti-Teacher Knowledge Distillation