Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Residual Advantage: Student-Relative Teacher Guidance for RL with Verifiable Rewards

    Oct 8, 2026Xiaobing Chen, Zhiqi PangRL for Language Model ReasoningRL Post-Training

  2. Measuring and Mitigating Solution Mode Collapse in RLVR

    Oct 8, 2026Liv G. d'Aliberti, Marwa Abdulhai, Sofiia Druchyna +2Mode CollapseRL Post-Training

  3. VICO: Visual Environments Co-Evolving for Vision-Language Model Reasoning

    Oct 7, 2026Meng Lu, Ligeng Zhu, Olivia Xiao +8VLM ReasoningRL for VLMs

  4. Decoupling Exploration from Optimization in RLVR

    Oct 7, 2026Saif Punjwani, Micah GoldblumRL for Language Model ReasoningRL Exploration

  5. Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents

    Oct 7, 2026Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis +2Reward Design for RLRL for IR

  6. VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

    Oct 6, 2026Zewei Zhou, Rachel Luo, Yulong Cao +10Reinforcement Learning with Verifiable RewardsSelf-Improving Agents

  7. Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

    Oct 6, 2026Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi +9Agentic RLRL for Language Model Reasoning

  8. What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training

    Oct 5, 2026Subham Rath, Raj Dandekar, Rajat Dandekar +1LLM EvaluationLanguage Model Generation Evaluation

  9. Minimal Witness Reinforcement Learning

    Oct 5, 2026T. Y. Tsui, Zihao Ye, Pengxiang Cai +3RL for Language Model ReasoningCredit Assignment in RL

  10. VERA: Scaling Verifiable Environments for Agentic co-Evolution

    Oct 5, 2026Junqi Liu, Yongyang Pan, Zhuosong Jiang +14Reinforcement Learning with Verifiable RewardsLong-Horizon LLM Agents

  11. Beyond Instruction Following: Learning Grounded Skill-Following with Skill Contracts

    Oct 4, 2026Jianghan Shen, Zhenjie Liu, Yue Li +10Reinforcement LearningLLM Agent Skill Learning

  12. KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

    Oct 1, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +1LLMs for CybersecurityLLM Tool Use

  13. On Language Drift during RLVR Post-Training

    Oct 1, 2026Michael Sullivan, Alexander KollerRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  14. Same Reward, Different Skills: When Multimodal RL Learns to Look

    Oct 1, 2026Haocun Ye, Xinlong Jiang, Qile Chen +6Reinforcement Learning with Verifiable RewardsVisual Grounding

  15. Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning

    Oct 1, 2026Zihan Liu, Xurong XieLLM Reasoning with GraphsRL for Language Model Reasoning

  16. Improving Math Reasoning through Value-guided Informative Search

    Oct 1, 2026Shaohuai Liu, Yuning Wu, Haoran Liu +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  17. Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It

    Oct 1, 2026Jonathan Williams, Esin Tureci Karthik R. NarasimhanRL for Language Model ReasoningLow-Rank Adaptation

  18. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  19. Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR

    Sep 30, 2026Chandak Chakma, Syed Nazmus Sakib, Nafiul Haque +1Reinforcement LearningRL for Language Model Reasoning

  20. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation

  21. From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

    Sep 30, 2026Yitong Qiao, Tiantian He, Lei Liu +4Agentic RLReinforcement Learning with Verifiable Rewards

  22. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning