RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

    Sep 8, 2026Youngrok Park, Sangmin Bae, Hojung Jung +6Policy GradientWeak-to-Strong Generalization

  2. TV-Regulated OPD: Direction Matters in On-Policy Distillation

    Sep 8, 2026Han Xiao, Yifan Niu, Dongyi Liu +2Preference OptimizationOn-Policy Distillation

  3. Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

    Sep 3, 2026Boyan Li, Bingsen Chen, Chenghao Yang +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  4. DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

    Sep 3, 2026Shubham Gandhi, Saurabh Goyal, Kiran Kate +1Agentic RLStep-Level Credit Assignment in RL

  5. Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO

    Sep 3, 2026Hyun Bin Park, Du-Seong ChangRL for Language Model ReasoningGroup Relative Policy Optimization

  6. LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

    Sep 3, 2026Sijie Wang, Zhiqiang Tan, Xinrui Yang +1RL for Diffusion ModelsRL Post-Training

  7. CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training

    Sep 1, 2026Siyuan Li, Xinxin Song, Chen Ruinian +5Reward HackingRubric-Based RL

  8. On-policy Distillation with Verifiable Reward

    Aug 25, 2026Wenze Lin, Jiale Zhao, Xitai Jiang +5RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  9. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Group Relative Policy OptimizationStep-Level Credit Assignment in RL

  10. Scaling Automatic Research Agents via World Models

    Aug 12, 2026Xiyuan Yang, Sheikh Sarwar, Jingru Cheng +8World Model LearningRL Post-Training

  11. GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

    Aug 12, 2026Kai Yang, Jingwei Xu, Wanyu Wang +4RL for Language Model ReasoningConstrained RL

  12. Scheduling Mixed RL Rollouts Beyond Prefix Locality

    Aug 11, 2026Zetao Hong, Song Yuan, Yuanhao Ding +4LLM Inference SchedulingKV-Cache Management

  13. MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training

    Aug 11, 2026Yikai Wang, Chuansai Zhou, Yuhang Zhou +10RL Post-TrainingMixture-of-Experts Models

  14. RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

    Aug 10, 2026Boxiong Wang, Hui Kang, Geng Sun +3UAV NavigationVision-Language Navigation

  15. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

    Aug 10, 2026Ting Zhou, Zhenqing Ling, Daoyuan Chen +4Reinforcement LearningRL for Language Model Reasoning

  16. Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

    Aug 8, 2026Binwen Tan, Jingchao Wang, Dengzhe Hou +6RL for Language Model ReasoningMulti-Task RL

  17. Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models

    Aug 8, 2026Jianqi Zhang, Xingyu Zhang, Zeen Song +3Time Series ForecastingRL Post-Training

  18. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Token-Level Credit AssignmentCredit Assignment in RL

  19. Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

    Aug 7, 2026Oseong Choi, Hoeinn Kim, Jihoon Lee +2Recommender SystemsRL Post-Training

  20. CrystalGRPO: Target-Aligned and Coverage-Preserving Reinforcement Learning for Flow-Based Crystal Structure Prediction

    Aug 6, 2026Kaixiang Su, Hongfei Xue, Qiang ZhuCrystal Structure PredictionGroup Relative Policy Optimization

  21. Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

    Aug 5, 2026Zheyuan Zhang, Manqing Mao, Hong Wang +8RL for Language ModelsRL Post-Training

  22. Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

    Aug 5, 2026Yi Yang, Cong Qin, Xiaodan Liu +8Agentic RLOn-Policy Distillation

  23. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

    Aug 4, 2026Jinhe Bi, Chennan Zhou, Zengjie Jin +10RL for Language Model ReasoningRL Post-Training

  24. Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

    Aug 4, 2026Yibei Liu, Jiajun Chen, Qianle Zhang +4Multimodal Large Language ModelsRisk-Sensitive RL

  25. Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy

    Aug 3, 2026Jim Dilkes, Vahid Yazdanpanah, Sebastian SteinRL for Language Model ReasoningRL Post-Training