Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

    Jun 3, 2026Ningyuan Xi, Hao Xu, Hongsheng Xin +1RL for Language Model ReasoningMathematical Reasoning

  2. Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection

    Jun 2, 2026Senjie Jin, Peixin Wang, Boyang Liu +8Token-Level Credit AssignmentVisual Reasoning

  3. Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

    Jun 2, 2026Jiahui Li, Jianfeng Shan, Wenpei Chen +5Reinforcement LearningLLM Answer Verification

  4. Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

    Jun 2, 2026Ziyue Wang, Aomufei Yuan, Yongfu Zhu +10LLM AlignmentRL for Language Model Reasoning

  5. Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR

    Jun 2, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +3Continual Learning for LLMsReinforcement Learning

  6. Self-Distilled Policy Gradient

    Jun 2, 2026Yifeng Liu, Shiyuan Zhang, Yifan Zhang +1Policy GradientOn-Policy Self-Distillation

  7. Hint-Guided Diversified Policy Optimization for LLM Reasoning

    Jun 2, 2026Zhiyu Cao, Kaixin Wu, Mingjie Zhong +4Reasoning DiversityRL for Language Model Reasoning

  8. TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL

    Jun 1, 2026Tianze Yang, Yucheng Shi, Ruitong Sun +3Reinforcement LearningVLM Reasoning

  9. Deep Research as Rubric for Reinforcement Learning

    May 31, 2026Wangyi Mei, Zhouhong Gu, Zhenhan Bai +9Open-Ended GenerationReinforcement Learning

  10. CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

    May 29, 2026Yang Li, Gongle Xue, Yijia Guo +3RL for Language Model ReasoningGroup Relative Policy Optimization

  11. EchoRL: Reinforcement Learning via Rollout Echoing

    May 29, 2026Jinhe Bi, Aniri, Minglai Yang +9Reinforcement LearningRL for Language Model Reasoning

  12. Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination

    May 29, 2026Jiasheng Zheng, Boxi Cao, Boxi Yu +6RL for Code GenerationReinforcement Learning with Verifiable Rewards

  13. Automating Formal Verification with Reinforcement Learning and Recursive Inference

    May 29, 2026Max TanRL for Code GenerationInference-Time Search

  14. Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

    May 29, 2026Ruina Hu, Chen Wang, Lai Wei +5Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  15. VeriGate: Verifier-Gated Step-Level Supervision for GRPO

    May 28, 2026Aakriti Agrawal, Minghui Liu, Furong HuangProcess Reward ModelsRL for Language Model Reasoning

  16. Reinforcement Learning with Robust Rubric Rewards

    May 28, 2026Ya-Qi Yu, Hao Wang, Fangyu Hong +15Reinforcement LearningRubric-Based RL

  17. HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

    May 28, 2026Mohamed Sana, Nicola Piovesan, Antonio De Domenico +2Group Relative Policy OptimizationPolicy Optimization

  18. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  19. When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

    May 28, 2026Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski +1RL for Language ModelsRL for Language Model Reasoning

  20. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    May 27, 2026Xinchen Zhang, Bowei Liu, Jiale Liu +7Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards