RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Compute Aligned Training: Optimizing for Test Time Inference

    Apr 27, 2026Adam Ousherovitch, Ambuj TewariTest-Time OptimizationInference-Time Scaling

  2. EPM-RL: Reinforcement Learning for On-Premise Product Mapping in E-Commerce

    Apr 27, 2026Minhyeong Yu, Wonduk SeoE-CommerceRL Post-Training

  3. JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training

    Apr 26, 2026Zhengding Hu, Hehua Ouyang, Chang Chen +6RL Post-TrainingPipeline Parallelism

  4. Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

    Apr 23, 2026Qinan Yu, Alexa Tartaglini, Peter Hase +2CoT FaithfulnessReinforcement Learning with Verifiable Rewards

  5. When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

    Apr 23, 2026Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay +2Offline RLRL Post-Training

  6. ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

    Apr 22, 2026Shelly Golan, Michael Finkelson, Ariel Bereslavsky +2Multi-Objective Reinforcement LearningRL for Image Generation

  7. EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

    Apr 21, 2026Chengjun Pan, Shichun Liu, Jiahang Lin +10RL for Language ModelsPolicy Gradient Methods

  8. Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

    Apr 20, 2026Zhenwen Liang, Yujun Zhou, Sidi Lu +3Reinforcement LearningRL for Language Model Reasoning

  9. Poly-EPO: Training Exploratory Reasoning Models

    Apr 19, 2026Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam +5Reinforcement LearningRL for Language Model Reasoning

  10. Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs

    Apr 19, 2026Carissa Cullen, Harry Garland, Alexander Roman +3Agent ReliabilityAI Agent Safety

  11. A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

    Apr 19, 2026Zhiyin Yu, Yuchen Mou, Juncheng Yan +17RL for Language ModelsRL Post-Training

  12. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

    Apr 18, 2026Yifu Huo, Chenglong Wang, Ziming Zhu +9Reinforcement LearningRL for Language Model Reasoning

  13. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Reinforcement LearningRL Post-Training

  14. Beyond Distribution Sharpening: The Importance of Task Rewards

    Apr 17, 2026Sarthak Mittal, Leo Gagnon, Guillaume LajoieReinforcement LearningRL for Language Model Reasoning

  15. S-GRPO: Unified Post-Training for Large Vision-Language Models

    Apr 17, 2026Yuming Yan, Kai Tang, Sihong Chen +4VLM AdaptationGroup Relative Policy Optimization

  16. An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

    Apr 9, 2026Andreas Plesner, Francisco Guzmán, Anish AthalyeRL for Code GenerationReinforcement Learning

  17. Policy Improvement Reinforcement Learning

    Apr 1, 2026Huaiyang Wang, Xiaojie Li, Xiaohan Wang +10RL for Language ModelsRL for Language Model Reasoning

  18. GIPO: Gaussian Importance Sampling Policy Optimization

    Mar 4, 2026Chengxuan Lu, Zhenquan Zhang, Shukuan Wang +3Reinforcement LearningRL Post-Training

  19. Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

    Feb 17, 2026Jialu Wang, Heinrich Peters, Asad A. Butt +6LLM AlignmentGroup Relative Policy Optimization

  20. The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

    Feb 6, 2026Yingru Li, Jiawei Xu, Ziniu Li +10RL for Language Model ReasoningPolicy Gradient Methods

  21. HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

    Jan 30, 2026Weiqi Wang, Xin Liu, Binxuan Huang +13RL for Language ModelsRL for Language Model Reasoning

  22. Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

    Jan 29, 2026Lei Yang, Wei Bi, Chenxi Sun +2RL for Language Model ReasoningRL Exploration

  23. R2^2PO: Decoupling Rollout and Inference Policies for LLM Reasoning

    Jan 17, 2026Jingchu Wang, Bingbing Xu, Yige Yuan +4RL for Language Model ReasoningPolicy Optimization

  24. Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

    Nov 25, 2025Chenliang Li, Adel Elmahdy, Alex Boyd +7RL for Language Model ReasoningImportance Sampling

  25. Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting

    Oct 21, 2025Howard Chen, Noam Razin, Karthik Narasimhan +1Continual Learning for LLMsRL Post-Training

  26. Representation-Based Exploration for Language Models: From Test-Time to Post-Training

    Oct 13, 2025Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy +1RL for Language Model ReasoningTest-Time Scaling