Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR

    Jun 23, 2026Yongjin Yang, Jiarui Liu, Yinghui He +3RL for Language Model ReasoningCurriculum RL

  2. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

    Jun 23, 2026Wenyang Hu, Junxiang Jia, Zhen Shu +3RL for Language ModelsRL for Language Model Reasoning

  3. SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

    Jun 23, 2026Sheng Xia, Zhengqin Lai, Tianxiang Jiang +4Temporal Video GroundingVideo Reasoning

  4. Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI

    Jun 22, 2026Armin Heydari, Torben LeowaldFormal VerificationReinforcement Learning with Verifiable Rewards

  5. What are Key Factors for Updates in RL for LLM Reasoning?

    Jun 21, 2026Peidong Wang, Demi Wang, Xufang Luo +5Reinforcement LearningRL for Language Model Reasoning

  6. Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

    Jun 21, 2026Pengxiang Cai, Tianchen Fang, Xiaohan Li +3RL for Language Model ReasoningCurriculum RL

  7. Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

    Jun 20, 2026Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin ParkCompositional ReasoningRL for Language Model Reasoning

  8. When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

    Jun 18, 2026Xiaolong Jin, Xuandong Zhao, Wenbo Guo +2RL for Code GenerationIntrinsic Reward Methods

  9. ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

    Jun 18, 2026Yuhan Liu, Pei Fu, Hang Li +8Reinforcement LearningMultimodal Large Language Models

  10. VIMPO: Value-Implicit Policy Optimization for LLMs

    Jun 18, 2026Zhewei Kang, Aosong Feng, Sergey Levine +2RL for Language Model ReasoningPolicy Optimization

  11. Reward as An Agent for Embodied World Models

    Jun 18, 2026Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking

  12. Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

    Jun 18, 2026Xuanzhi Feng, Zhengyang Li, Zeyu Liu +6Reinforcement LearningRL for Language Model Reasoning

  13. STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

    Jun 17, 2026Haipeng Luo, Qingfeng Sun, Songli Wu +4RL for Language Model ReasoningMaximum Entropy RL

  14. GraphPO: Graph-based Policy Optimization for Reasoning Models

    Jun 17, 2026Yuliang Zhan, Xinyu Tang, Jian Li +7Reinforcement LearningLLM Reasoning with Graphs

  15. Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards

    Jun 17, 2026Yingyu Shan, Yuhang Guo, Zihao Cheng +7Token-Level Credit AssignmentRL for Language Model Reasoning

  16. Sparsity Curse: Understanding RLVR Model Parameter Space from Model Merging

    Jun 16, 2026Chenrui Wu, Zexi Li, Jiajun Bu +2Reinforcement Learning with Verifiable RewardsLanguage Model Merging

  17. Rethinking Groups in Critic-Free RLVR

    Jun 15, 2026Yihong Wu, Liheng Ma, Lingfeng Xiao +4Reinforcement LearningRL for Language Model Reasoning

  18. DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

    Jun 15, 2026Minghang Zhu, Chuyang Wei, Junhao Xu +3Deep Research AgentsRubric-Based RL

  19. STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

    Jun 14, 2026Qinjian Zhao, Zhihao Dou, Dinggen Zhang +10RL for Language Model ReasoningCredit Assignment in RL

  20. Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

    Jun 14, 2026Yu Li, Shu Hong, Tian LanRL for Language Model ReasoningCredit Assignment in RL

  21. Understanding Diversity Collapse in RLVR via the Lens of Overtraining

    Jun 13, 2026Suqin Yuan, Jinkun Chen, Jiyang Zheng +6Reinforcement LearningReasoning Diversity

  22. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  23. MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling

    Jun 11, 2026Jiacheng Chen, Xinyu Zhang, Shunkai Zhang +20Automated Theorem ProvingInference-Time Scaling

  24. ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

    Jun 11, 2026Xucong Wang, Ziyu Ma, Yong Wang +5RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards