RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

    Jun 24, 2026Changdae Oh, Wendi Li, Seongheon Park +3Process Reward ModelsRL Post-Training

  2. Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

    Jun 24, 2026Guozheng Ma, Lu Li, Zilin Wang +2Reinforcement LearningRL Post-Training

  3. Reinforcement Learning Towards Broadly and Persistently Beneficial Models

    Jun 22, 2026Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab +5LLM AlignmentLLM Safety Alignment

  4. On the Position Bias of On-Policy Distillation

    Jun 21, 2026Yan Xie, Sijie Zhu, Tiansheng Wen +2Importance WeightingLanguage Model Distillation

  5. Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

    Jun 21, 2026Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang +7Reinforcement LearningRL for Language Model Reasoning

  6. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL

  7. World Engine: Towards the Era of Post-Training for Autonomous Driving

    Jun 18, 2026Tianyu Li, Li Chen, Caojun Wang +16Autonomous DrivingRL Post-Training

  8. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion TransformerRL for Image Generation

  9. Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards

    Jun 17, 2026Yingyu Shan, Yuhang Guo, Zihao Cheng +7Token-Level Credit AssignmentRL for Language Model Reasoning

  10. LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

    Jun 16, 2026Haoyang Fang, Wei Zhu, Boran Han +11Reinforcement LearningLarge Language Model-Guided Optimization

  11. Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

    Jun 16, 2026Zihao Wei, Wenjie Shi, Liang Pang +8Overthinking in Language ModelsRL for Language Model Reasoning

  12. From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

    Jun 16, 2026Chao Chen, Chengzu Li, Zhiwei Li +2Reinforcement LearningLLM-Guided RL

  13. GD2^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

    Jun 15, 2026Haotian Liu, Yihao Liu, Jingwei Ni +11Multi-Objective Reinforcement LearningRL for Language Models

  14. How Post-Training Shapes Biological Reasoning Models

    Jun 15, 2026Lukas Fesser, Hanlin Zhang, Michelle M. Li +5Neural Network GeneralizationSupervised Fine-Tuning

  15. PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents

    Jun 15, 2026Zhenbang Du, Jun Luo, Zhiwei Zheng +8Learning from DemonstrationLLM Agent Training

  16. Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

    Jun 11, 2026Akshay Krishnamurthy, Audrey Huang, Nived RajaramanRL for Language Model ReasoningRL Post-Training

  17. Rethinking the Divergence Regularization in LLM RL

    Jun 8, 2026Jiarui Yao, Xiangxin Zhou, Penghui Qi +3RL for Language ModelsPolicy Optimization

  18. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL