Critic-Free RL

RL: Reinforcement Learning

Momentum

4 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 17

All topics
CardsList
  1. RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

    Oct 5, 2026Sayak Chakrabarti, Sathish Reddy IndurthiGroup Relative Policy OptimizationCredit Assignment in RL

  2. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Agentic RLStep-Level Credit Assignment in RL

  3. GR2PO: Group Relative Return Policy Optimization for Continuous Robot Control

    Sep 17, 2026Pengqin Wang, Qiming Zhang, Shaojie Shen +1Reinforcement LearningGroup Relative Policy Optimization

  4. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  5. Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

    Sep 11, 2026Taoran Liang, Yang Liu, Shang Luo +10Credit Assignment in RLStep-Level Credit Assignment in RL

  6. When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

    Jul 8, 2026Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang +4RL for Language ModelsToken-Level Credit Assignment

  7. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement LearningRL for Language Model Reasoning

  8. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement LearningRL for Language Model Reasoning

  9. VIMPO: Value-Implicit Policy Optimization for LLMs

    Jun 18, 2026Zhewei Kang, Aosong Feng, Sergey Levine +2RL for Language Model ReasoningPolicy Optimization

  10. Rethinking Groups in Critic-Free RLVR

    Jun 15, 2026Yihong Wu, Liheng Ma, Lingfeng Xiao +4Reinforcement LearningRL for Language Model Reasoning

  11. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL

  12. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1RL for Language ModelsPolicy Gradient

  13. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  14. The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

    May 9, 2026Tianhao Cheng, Zeyu Huang, Zihan Qiu +5Reinforcement LearningToken-Level Credit Assignment

  15. Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation

    May 1, 2026Xin-Ye Li, Ren-Biao Liu, Yun-Ji Zhang +3RL for Code GenerationReinforcement Learning

  16. Constrained Group Relative Policy Optimization

    Feb 5, 2026Roger Girgis, Rodrigue de Schaetzen, Luke Rowe +3Group Relative Policy OptimizationConstrained RL