RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. DAPD: Dual-Anchored Policy Distillation

    Aug 3, 2026Jianyu Wu, Yizhou Wang, Encheng Su +2On-Policy Self-DistillationLanguage Model Distillation

  2. RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

    Jul 31, 2026Chengbo Liu, Lifang Zhou, Ruijie Yan +8Reward ShapingOffline RL

  3. Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

    Jul 31, 2026Xujun Che, Yuchen Yuan, Weida Zhao +1Reinforcement LearningKL-Regularized RL

  4. Cross-Benchmark Generalization in Long-Horizon Agents

    Jul 31, 2026Sushant Mehta, Logan Ritchie, Liudas Panavas +1Long-Horizon Agent EvaluationRL Post-Training

  5. X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

    Jul 30, 2026Tianyu Yang, Yiming Zeng, Wenzhe Cai +5Robot NavigationPolicy Optimization

  6. HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

    Jul 30, 2026Tiangang Li, Xiangbo TianRL for Language ModelsLLM Alignment

  7. TAPO: Transition-Aware Policy Optimization for LLM Agents

    Jul 30, 2026Cong Li, Peixi Peng, Yisen Zhao +4Reinforcement LearningRL Post-Training

  8. ReCo: Reweighting GRPO Against Distributional Concentration

    Jul 29, 2026Junoh Park, Junseo Hwang, Wonguk Cho +1Reasoning DiversityRL for Language Model Reasoning

  9. RLPF: Reinforcement Learning from Performance Feedback for Code Generation

    Jul 29, 2026Huihao Jing, Haozhe Cui, Wenbin Hu +9RL for Code GenerationReinforcement Learning

  10. Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning

    Jul 24, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +5Asynchronous RLRL for Language Model Reasoning

  11. Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

    Jul 24, 2026Zixuan Ren, Jinliang Lu, Junhong Wu +5RL for Language ModelsLanguage Model Merging

  12. QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization

    Jul 23, 2026Siwei Chen, Siqi Chen, Xupeng Miao +1Overthinking in Language ModelsRL for Language Model Reasoning

  13. Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

    Jul 22, 2026Roger Sala Sisó, Tiago Silvério, Jakob Sand +1Robotic ManipulationVision-Language-Action Models

  14. Rewarding Better Thinking for LLM Preference Alignment

    Jul 22, 2026Xubo Liu, Wenya Guo, Ruxue Yan +2Process Reward ModelsCredit Assignment in RL

  15. ISO: An RLVR-Native Optimization Stack

    Jul 21, 2026Hanqing Zhu, Wenyan Cong, Zhizhou Sha +8Reinforcement Learning with Verifiable RewardsRL Post-Training

  16. REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

    Jul 21, 2026Yunjie Chen, Xiaoxin Chen, Fang WangRL for Language ModelsRL for Language Model Reasoning

  17. Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    Jul 21, 2026Junyao Yang, Yucheng Shi, Zongxia Li +6Asynchronous RLProximal Policy Optimization

  18. RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

    Jul 20, 2026Yuxin Xiong, Xunyi Jiang, Rohan Surana +8Reinforcement LearningRL for Language Model Reasoning

  19. OR Else: A Differentiable Trust Region for Policy Optimization

    Jul 20, 2026Chinmay Rane, Kanishka Tyagi, Michael ManryRL for Language ModelsGroup Relative Policy Optimization

  20. LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

    Jul 20, 2026Tianzhu Ye, Li Dong, Guanheng Chen +4Reinforcement LearningRubric-Based RL

  21. Distilled Reinforcement Learning for LLM Post-training

    Jul 19, 2026Chen Wang, Zhaochun Li, Jionghao Bai +4RL for Language Model ReasoningCross-Architecture Knowledge Distillation

  22. When Does Muon Help Agentic Reinforcement Learning?

    Jul 17, 2026Kai Ruan, Jinghao Lin, Zihe Huang +4Agentic RLMuon Optimizer

  23. Understanding Reasoning from Pretraining to Post-Training

    Jul 17, 2026Jingyan Shen, Ang Li, Salman Rahman +4Language Model PretrainingRL for Language Model Reasoning

  24. LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

    Jul 16, 2026Changhai Zhou, Kieran Liu, Yuhua Zhou +17Efficient Language Model TrainingLong-Context Modeling

  25. TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

    Jul 15, 2026Leitian Tao, Baolin Peng, Wenlin Yao +5Credit Assignment in RLStep-Level Credit Assignment in RL

  26. Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration

    Jul 15, 2026Shuhao Li, Guodong Du, Anhao Zhao +3Confidence Estimation in Language ModelsLanguage Model Calibration

  27. GFlowRL: Scaling Distribution-Matching RL to Large Language Models

    Jul 15, 2026Xiaodong Liu, Michael Xu, Jack W. Stokes +3RL for Code GenerationReinforcement Learning