RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

    Jul 14, 2026Xinyu Tang, Qianggang Cao, Yurou Liu +13RL for Language ModelsRL for Language Model Reasoning

  2. Learning Residual Kinematic Corrections for Continuous Neural Decoding via Reinforcement Learning

    Jul 13, 2026Jiamian Li, Niall McShane, Attila Korik +6Brain-Computer InterfacesNeural Decoding

  3. Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

    Jul 13, 2026Daocheng Fu, Rong Wu, Yu Yang +7Large Language Model-Guided OptimizationRL Post-Training

  4. Predictive Divergence Masks for LLM RL

    Jul 12, 2026Xiangxin Zhou, Jiarui Yao, Penghui Qi +4RL for Language ModelsReinforcement Learning

  5. ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

    Jul 11, 2026Kexin Huang, Junkang Wu, Jinda Lu +7Reinforcement LearningKL-Regularized RL

  6. Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

    Jul 11, 2026Pengfei Cai, Utkarsh Utkarsh, Alan Edelman +2RL for Code GenerationScientific Code Generation

  7. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    Jul 11, 2026Zhicheng Cai, Xinyuan Guo, Hanlin Wu +3Reinforcement LearningRL for Language Model Reasoning

  8. REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation

    Jul 11, 2026Li Guo, Anas M. Tahir, Z. Jane WangRadiology Report GenerationRadiology VLMs

  9. PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

    Jul 10, 2026Yujie Pang, Zudong LiReinforcement LearningContact-Rich Robotic Manipulation

  10. Mach-Mind-4-Flash Technical Report

    Jul 10, 2026Foundation Model TeamAgentic RLToken Efficiency

  11. Post-Training in End-to-End Autonomous Driving

    Jul 9, 2026Ruining Yang, Muxing Wang, Yixiao Chen +8End-to-End Autonomous DrivingAutonomous Driving

  12. RL Post-Training Builds Compositional Reasoning Strategies

    Jul 8, 2026Azwar Abdulsalam, Nishil Patel, Andrew SaxeCompositional ReasoningRL for Language Model Reasoning

  13. Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

    Jul 8, 2026Zhenyu Hou, Yujiang Li, Jie Tang +1Agentic RLAsynchronous RL

  14. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Jul 8, 2026Chongyu Fan, Pengfei Liu, Jingjia Huang +2RL for Language Model ReasoningPolicy Optimization

  15. Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

    Jul 7, 2026Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas +3Robot Policy AdaptationQ-Learning

  16. RL Forgets! Towards Continual Policy Optimization

    Jul 5, 2026Mao-Lin Luo, Zhe-Xu Wang, Zi-Hao Zhou +4RL Post-TrainingContinual Learning for VLMs

  17. Spectral Rewiring for Exploration, Purification, and Model Merging

    Jul 3, 2026Zhilong Zhang, Hongli Yu, Huan-ang Gao +5RL for Language Model ReasoningRL Post-Training

  18. Denser ≠\neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training

    Jul 2, 2026Meng Wang, Haohan Zhao, Wenzhuo Liu +7Continual Learning for LLMsOn-Policy Self-Distillation

  19. Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

    Jul 1, 2026Juliette Decugis, Sean O'Brien, Francis Bach +2Policy GradientRL for Language Model Reasoning

  20. Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

    Jul 1, 2026Zijian Zhang, Rizhen Hu, Athanasios Glentis +4RL for Language ModelsFine-Tuning

  21. Scaling Laws for Collapse in Asynchronous GRPO

    Jul 1, 2026Jingwei Song, Haofeng Xu, Jie Xiao +7Asynchronous RLReinforcement Learning

  22. MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

    Jun 29, 2026Wenhan Ma, Jianyu Wei, Liang Zhao +10Multi-Teacher Knowledge DistillationOn-Policy Distillation

  23. ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents

    Jun 26, 2026Qitai Tan, Zefang Zong, Yang Li +1Agentic RLOn-Policy Distillation

  24. NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

    Jun 26, 2026Tianlin Pan, Lianyu Pang, Cheng Da +4Flow MatchingRL for Image Generation

  25. Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

    Jun 25, 2026Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang +6RL for Code GenerationReinforcement Learning

  26. RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

    Jun 25, 2026Rongjian Chen, Jianmin Hu, Kejiang Ye +1Reinforcement LearningRL for Language Model Reasoning