RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

    Jun 8, 2026Jike Zhong, Yuxiang Lai, Ming Li +5Theory of MindRL for Language Model Reasoning

  2. Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

    Jun 7, 2026Jiashun Liu, Runze Liu, Xu Wan +3RL for Language ModelsConstrained RL

  3. When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

    Jun 7, 2026Runze Liu, Jiashun Liu, Xu Wan +2Supervised Fine-TuningRL Post-Training

  4. On Advantage Estimates for Max@K Policy Gradients

    Jun 4, 2026Shota Takashiro, Soichiro Nishimori, Paavo Parmas +6Policy GradientPolicy Gradient Methods

  5. Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

    Jun 4, 2026Yiming Zong, Yige Wang, Jiashuo JiangSequential Decision MakingRL for Language Model Reasoning

  6. Rollout-Level Advantage-Prioritized Experience Replay for GRPO

    Jun 3, 2026Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang +2RL for Language Model ReasoningGroup Relative Policy Optimization

  7. When Should the Teacher Move? Temporal Coupling and Stability in Self On-Policy Distillation

    Jun 2, 2026Haowei Guo, Baolong Bi, Ruicheng Zhang +2On-Policy Self-DistillationLanguage Model Distillation

  8. Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR

    Jun 2, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +3Continual Learning for LLMsReinforcement Learning

  9. Libra: Efficient Resource Management for Agentic RL Post-Training

    Jun 2, 2026Kaiwen Chen, Xin Tan, Jingzong Li +6Agentic RLReinforcement Learning

  10. Efficient Hyperparameter Optimization for LLM Reinforcement Learning

    Jun 2, 2026Minping Chen, Bowen Xiao, Du Liang +2RL for Language ModelsRL Post-Training

  11. A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

    Jun 1, 2026Lei Yang, Siyu Ding, Deyi XiongRL for Language ModelsReinforcement Learning

  12. A Primer in Post-Training Reasoning Data: What We Know About How It Works

    Jun 1, 2026Yaoming Li, Guangxiang Zhao, Qilong Shi +3RL Post-TrainingLLM Post-Training

  13. TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL

    Jun 1, 2026Tianze Yang, Yucheng Shi, Ruitong Sun +3Reinforcement LearningVLM Reasoning

  14. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

    May 29, 2026Daize Dong, Junlin Chen, Haolong Jia +9RL for Language Model ReasoningExpert Routing

  15. Consolidating Rewarded Perturbations for LLM Post-Training

    May 29, 2026Zheyu Zhang, Shuo Yang, Gjergji KasneciRL Post-TrainingLanguage Model Post-Training

  16. EchoRL: Reinforcement Learning via Rollout Echoing

    May 29, 2026Jinhe Bi, Aniri, Minglai Yang +9Reinforcement LearningRL for Language Model Reasoning

  17. The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

    May 29, 2026Xiaobo Wang, Tong Wu, Min Tang +3Reward ModelingLLM Alignment

  18. Distilling LLM Feedback for Lean Theorem Proving

    May 29, 2026Gaetan Narozniak, Gérard Biau, Rémi Munos +2RL for Language Model ReasoningMathematical Reasoning

  19. HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

    May 28, 2026Mohamed Sana, Nicola Piovesan, Antonio De Domenico +2Group Relative Policy OptimizationPolicy Optimization

  20. A Predictive Law for On-Policy Self-Distillation From World Feedback

    May 28, 2026Tommy He, Jerome Sieber, Matteo SaponatiOn-Policy Self-DistillationRL Post-Training

  21. LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

    May 28, 2026Minju Gwak, Minseo Kwak, Dongseok Lee +3Data Contamination in Language ModelsRL Post-Training

  22. Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

    May 28, 2026Zizhe Chen, Jiqian Dong, Yizhou Tian +4RL for Language ModelsValue Function Estimation

  23. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  24. Label-Free Reinforcement Learning via Cross-Model Entropy

    May 27, 2026Matt Gorbett, Hossein ShiraziReinforcement LearningInstruction Following

  25. DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

    May 27, 2026Caijun Xu, Changyi Xiao, Zhongyuan Peng +1LLM Self-CorrectionRL for Language Model Reasoning