Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL

    May 27, 2026Kunhao Zheng, Pierre Chambon, Juliette Decugis +4Multi-Objective Reinforcement LearningRL for Code Generation

  2. Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

    May 27, 2026Jianghao Wu, Jianfei Cai, Weiqiang Wang +3Training Data SelectionReinforcement Learning with Verifiable Rewards

  3. Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

    May 27, 2026Saurabh Dash, Pierre Clavier, John Dang +4Reinforcement LearningInstruction Following

  4. Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs

    May 27, 2026Yue Cheng, Jiajun Zhang, Xiaohui Gao +3Reinforcement LearningRL for Language Model Reasoning

  5. Diversifying RLVR Rollouts via First-Token Exploration

    May 27, 2026Soeun Kim, Albert NoRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  6. IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

    May 27, 2026Yuhan Li, Mingxu Zhang, Dazhong Shen +1Reinforcement LearningRL for Language Model Reasoning

  7. Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

    May 27, 2026Zili Wang, Jiajun Chai, Lin Chen +3Multi-Token PredictionRL for Language Model Reasoning

  8. ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay

    May 27, 2026Zhexin Hu, Li Wang, Xiaohan Wang +4LLM CompressionReinforcement Learning with Verifiable Rewards

  9. VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

    May 27, 2026Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang +13Image CaptioningObject Hallucination in VLMs

  10. Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

    May 27, 2026Le Bronnec Florian, Alexandre Verine, Rio Yokota +1RL for Code GenerationCode Generation

  11. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL

  12. RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data

    May 26, 2026Hsiu-Yuan Huang, Weijie Liu, Chenming Tang +5Data ProvenanceReinforcement Learning with Verifiable Rewards

  13. Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks

    May 26, 2026Yihua Zhu, Qianying Liu, Fei Cheng +4Logical ReasoningAbductive Reasoning

  14. MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research

    May 25, 2026Dingbang Wu, Rui Hao, Haiyang Wang +8Mobile GUI AutomationGUI Agents

  15. When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

    May 25, 2026Li Wang, Xiaodong Lu, Xiaohan Wang +5Reinforcement LearningRL for Language Model Reasoning

  16. CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents

    May 25, 2026Bowen Wang, Dunjie Lu, Junli Wang +11Computer-Use AgentsSynthetic Data Generation

  17. Credit Assignment with Resets in Language Model Reasoning

    May 25, 2026Ankur Samanta, Akshayaa Magesh, Ayush Jain +7RL for Language Model ReasoningCredit Assignment in RL

  18. Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

    May 25, 2026Fanhu Zeng, Zhicong Luo, Zefan Wang +3Visual ReasoningMultimodal Reasoning

  19. Not only where, But when: Temporal Scheduling for RLVR

    May 25, 2026Jinghao Zhang, Ruilin Li, Feng Zhao +1RL for Language Model ReasoningCredit Assignment in RL

  20. Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

    May 24, 2026Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng +2Reinforcement LearningRL for Language Model Reasoning

  21. Hide to Guide: Learning via Semantic Masking

    May 24, 2026Ruitao Liu, Qinghao Hu, Alex Hu +6Reward HackingRL for Language Model Reasoning

  22. RL with Learnable Textual Feedback: A Bilevel Approach

    May 23, 2026Utsav Singh, Sidhaarth Sredharan, Souradip Chakraborty +1Reinforcement LearningRL for Language Model Reasoning

  23. One-Way Policy Optimization for Self-Evolving LLMs

    May 21, 2026Shuo Yang, Jinda Lu, Kexin Huang +6Policy OptimizationReinforcement Learning with Verifiable Rewards

  24. From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

    May 21, 2026Xitai Jiang, Zihan Tang, Wenze Lin +3RL for Language Model ReasoningCredit Assignment in RL

  25. ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking

    May 21, 2026Miaobo Hu, Shuhao Hu, BoKun Wang +5Data ProvenanceLearning to Rank