Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning

    Aug 22, 2026Chenghao Zhang, Yuxi Cheng, Saisai Hu +3Reinforcement Learning with Verifiable RewardsWeb Agents

  2. Beyond Forgetting: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

    Aug 19, 2026Lirui Luo, Guoxi Zhang, Hongming Xu +3RL for Language Model ReasoningReplay-Based Continual Learning

  3. Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

    Aug 13, 2026Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3Token-Level Credit AssignmentStep-Level Credit Assignment in RL

  4. PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

    Aug 11, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Inverse Probability WeightingReinforcement Learning

  5. ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering

    Aug 11, 2026Taojie Zhu, Yuan Xia, Tao Sun +8Rubric-Based RLMedical QA

  6. Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue

    Aug 11, 2026Yi Wei, Shuo Jiang, Huaixia Dou +5Reinforcement Learning with Verifiable RewardsCurriculum Learning

  7. Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation

    Aug 10, 2026Yubo Jiang, Fengying Xie, Zhiguo Jiang +1On-Policy Self-DistillationRL for Language Model Reasoning

  8. Parameter Exploration for RLVR via Variational Learning

    Aug 10, 2026Vatsal Venkatkrishna, Nico Daheim, Iryna GurevychRL for Language Model ReasoningRL Exploration

  9. LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

    Aug 9, 2026Juncheng Dong, Ding Tong, Ishan Gupta +1Reinforcement Learning with Verifiable Rewards

  10. Improving Generalization Robustness of Multimodal RLVR

    Aug 9, 2026Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng +11Multimodal RobustnessMultimodal Large Language Models

  11. DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

    Aug 7, 2026Xucong Wang, Zhe Zhao, Liheng Yu +3RL for Code GenerationCredit Assignment in RL

  12. WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

    Aug 6, 2026Boshui Chen, Huiping Liu, Shaolei ZhangRL for Code GenerationAutomated Software Testing

  13. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

    Aug 6, 2026ZhiYan Hou, Xinyu Tang, Hongyan An +9On-Policy Self-DistillationRL for Language Model Reasoning

  14. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic RLReinforcement Learning

  15. WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

    Aug 5, 2026Bohai Gu, Yueyang Yuan, Taiyi Wu +9World Model-Based PlanningAction-Conditioned World Models

  16. Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

    Aug 5, 2026Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi +6Autonomous Cyber DefenseLLM Red Teaming

  17. Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

    Aug 4, 2026Yongshi Ye, Liang Zhang, Yidong Chen +2RL for Language Model ReasoningGroup Relative Policy Optimization

  18. BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

    Aug 3, 2026Soumadeep Saha, Krish Sharma, Akshay Chaturvedi +1Reasoning DiversityRL for Language Model Reasoning

  19. Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

    Aug 3, 2026Fangxu Yu, Tao Feng, Dehai Min +6Audio ReasoningRubric-Based RL

  20. Start Classifying: Categorical Critics for LLM Reinforcement Learning

    Aug 3, 2026Zhijian Zhou, Long Li, Xuan Zhang +7RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  21. Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

    Aug 3, 2026Zixuan Huang, Yang Zhou, Kaixuan Wang +7VLM ReasoningReinforcement Learning with Verifiable Rewards

  22. EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +4Agentic SearchCredit Assignment in RL

  23. Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

    Aug 1, 2026Zhuowen Han, Jinwei Xiao, Zhengxi Lu +9Self-Training for Language ModelsRL for Language Model Reasoning