Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

    Apr 28, 2026Xinjie Chen, Biao Fu, Jing Wu +4RL for Language Model ReasoningMathematical Reasoning

  2. Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance

    Apr 25, 2026Xinzhu Chen, Wei He, Huichuan Fan +7Token-Level Credit AssignmentGroup Relative Policy Optimization

  3. Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

    Apr 23, 2026Qinan Yu, Alexa Tartaglini, Peter Hase +2CoT FaithfulnessReinforcement Learning with Verifiable Rewards

  4. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  5. Learning from the Near Future: Temporal Self-Distillation for RLVR

    Apr 22, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement Learning with Verifiable RewardsSelf-Distillation

  6. SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  7. GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

    Apr 22, 2026Jingyi Wang, Lei Zhu, Tengjin Weng +8RL for Language Model ReasoningGroup Relative Policy Optimization

  8. AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

    Apr 21, 2026Yiming Pan, Chengwei Hu, Xuancheng Huang +6LLM AlignmentReinforcement Learning with Verifiable Rewards

  9. When Can LLMs Learn to Reason with Weak Supervision?

    Apr 20, 2026Salman Rahman, Jingyan Shen, Anna Mordvina +3Supervised Fine-TuningRL for Language Model Reasoning

  10. OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

    Apr 20, 2026Xinyu Ma, Mingzhou Xu, Xuebo Liu +4Reward ShapingRL for Language Model Reasoning

  11. Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

    Apr 20, 2026Md Rysul Kabir, Zoran TiganjLanguage Model Safety EvaluationLLM Interpretability

  12. Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

    Apr 20, 2026Justin Bauer, Thomas Walshe, Derek Pham +4RL for Language Model ReasoningSmall Language Models

  13. QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning

    Apr 20, 2026Songxin Qu, Tai-Ping Sun, Yun-Jie Wang +8Reward ModelingScientific QA

  14. HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

    Apr 20, 2026Zhanyu Liu, Qingguo Hu, Ante Wang +5RL for Language Model ReasoningFew-Shot Learning

  15. Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

    Apr 20, 2026Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga +1CoT ReasoningRL for Language Model Reasoning

  16. TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

    Apr 19, 2026Yirong Zeng, Yufei Liu, Xiao Ding +9Reward ModelingLLM Alignment

  17. EasyVideoR1: Easier RL for Video Understanding

    Apr 18, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement LearningVideo-Language Models

  18. Detecting and Suppressing Reward Hacking with Gradient Fingerprints

    Apr 17, 2026Songtao Wang, Quang Hieu Pham, Fangcong Yin +4Reward HackingReinforcement Learning with Verifiable Rewards

  19. LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

    Apr 16, 2026Lukas Helff, Quentin Delfosse, David Steinmann +6Reward HackingLogical Reasoning

  20. An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

    Apr 9, 2026Andreas Plesner, Francisco Guzmán, Anish AthalyeRL for Code GenerationReinforcement Learning

  21. P^2O: Joint Policy and Prompt Optimization

    Mar 23, 2026Xinyu Lu, Kaiqi Zhang, Jinglin Yang +6RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  22. RAWR: Reward Assignment Without Rollouts in Verifiable Domains

    Mar 18, 2026Corentin Royer, Anna Hedström, Debarun Bhattacharjya +3Process Reward ModelsReinforcement Learning with Verifiable Rewards