Reinforcement Learning with Verifiable Rewards

Also known as RLVR

Momentum

59 papers in the last four weeks, up 119% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 438

All topics
CardsList
  1. Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

    Sep 16, 2026Xinxin Song, Siyuan Li, Tingxiong Xiao +1Credit Assignment in RLExperience Replay

  2. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  3. MInTRL: Off-policy Intervention can boost On-policy RL

    Sep 14, 2026Mingyu Chen, Yefan Tao, Gerald Friedland +2Reinforcement LearningReinforcement Learning with Verifiable Rewards

  4. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Terminal AgentsLong-Horizon Agent Evaluation

  5. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReward ModelingReward Hacking

  6. ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR

    Sep 8, 2026Tommy Sha, Skylar Zhai, Siqi ZhaoRL for Language Model ReasoningGroup Relative Policy Optimization

  7. Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR

    Sep 8, 2026Youngjun Yu, Sanghwan Jang, Hwanjo YuRL for Language Model ReasoningRL Exploration

  8. CircuitLens: Reasoning Circuits as Data Selection Signals for Reinforcement Learning with Verifiable Rewards

    Sep 7, 2026Zhuofan Chen, Ziqian Jiao, Yikai Cui +3Numerical Reasoning in Language ModelsReinforcement Learning

  9. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8RL for Language Model ReasoningCredit Assignment in RL

  10. Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

    Sep 3, 2026Boyan Li, Bingsen Chen, Chenghao Yang +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  11. Spurious Advantage Hidden in GRPO

    Sep 3, 2026Jiamian Wang, Samyadeep Basu, Koustava Goswami +2Reinforcement LearningGroup Relative Policy Optimization

  12. FiMI Banking: A Sovereign Model for Indian Retail Banking

    Sep 3, 2026NPCI AI Research Team, Aman Kumar, Asit Desai +15Financial ServicesRL for Language Models

  13. Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards

    Sep 3, 2026Leqi Zheng, Jinbo Su, Fang Niu +8Numerical Reasoning in Language ModelsReward Shaping

  14. DE-Venus: A Data-Efficient RLVR Framework for Large Language Models

    Sep 3, 2026Shenzhi Yang, Guangcheng Zhu, Kai Tang +11RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  15. FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

    Sep 3, 2026Zixun Huang, Kishan Panaganti, Haitao Mi +1RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  16. Cliff: Learning Process Rewards from the First Mistake

    Sep 2, 2026Peixuan Han, Runhui Wang, Ketan Ramaneti +3Reinforcement Learning with Verifiable RewardsLLM Reasoning

  17. From Base Rollouts to RL Reasoning: A Budgeted Search Perspective

    Sep 1, 2026Wenhe Sun, Cunxiang Wang, Zijun Yao +1Inference-Time SearchRL for Language Model Reasoning

  18. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

    Sep 1, 2026Fanrui Zhang, Ruixue Ding, Qiang Zhang +13AI Agent BenchmarksRubric-Based RL

  19. Group Adaptive Clipping Policy Optimization

    Aug 31, 2026Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan +1Group Relative Policy OptimizationPolicy Optimization

  20. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

    Aug 31, 2026Zhiqin Yang, Jingwen Fu, Yuhan Liu +16Reinforcement LearningRL for Language Model Reasoning

  21. GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

    Aug 31, 2026Outongyi Lv, Yuanwei Zhang, Xiaoqun ZhangRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  22. ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

    Aug 28, 2026Xin Jiang, Minhao Wang, Wen Wu +4Reward ShapingRL for Language Model Reasoning

  23. On-policy Distillation with Verifiable Reward

    Aug 25, 2026Wenze Lin, Jiale Zhao, Xitai Jiang +5RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards