RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Beyond Compression: Diagnosing How Post-Training Changes Mathematical Reasoning

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Language Model DistillationRL Post-Training

  2. Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training

    Sep 29, 2026Chenliang Li, Neiwen Ling, Zijun Wei +1Asynchronous RLRL for Language Model Reasoning

  3. PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents

    Sep 28, 2026Jiazhou Zhou, Hu Zhou, Yucheng Chen +3On-Policy Self-DistillationReinforcement Learning with Verifiable Rewards

  4. Not All Rollouts Are Worth Learning: On Trajectory Valuation for Post-Training Reinforcement Learning

    Sep 28, 2026Xuesong Jia, Ziao Yang, Zhanhe Huang +1RL Post-TrainingData Valuation

  5. Nereus: Adaptive Parallelism for LLM Post-Training

    Sep 28, 2026Songlin Jiang, Tuo Shi, Sitong Zhang +3LLM Inference SchedulingRL Post-Training

  6. The Low-Rank Structure of VLA Reinforcement Learning

    Sep 28, 2026Minjae Oh, Yoonah Park, Jongwon Lim +1Vision-Language-Action ModelsRL Post-Training

  7. FlexLoop: Depth-Elastic Looped Policies for Adaptive Test-Time Computation in Deep RL

    Sep 28, 2026Xun Wang, Ruishuo Chen, Yu Chen +2Efficient Neural Network InferenceReinforcement Learning

  8. Learning Perturbation Robust Policies for LLM Agents with Stable Optimization

    Sep 28, 2026Pengxin Wang, Yuanzhe LI, Yuxin Ren +2RL Post-TrainingRobust RL

  9. Selecting Diverse SFT Traces Improves Post-RL Generalization

    Sep 27, 2026Dylan Zhang, Mingyuan Wu, Jinning LiReasoning DiversityRL for Language Model Reasoning

  10. Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training

    Sep 27, 2026Xinyu Che, Hang Yan, Yanchen Liu +5World Model LearningRL Post-Training

  11. PoEM: Predicting RL Outcomes from Existing Policies

    Sep 24, 2026Kimia Hamidieh, Giannis Daras, Antonio TorralbaRL for Generative ModelsRL Post-Training

  12. Rufus-Air: An Open LLM Post-Training Recipe

    Sep 24, 2026Chia-Yuan Chang, Renyuan Cheng, Rui Feng +19LLM Fine-TuningRL for Language Model Reasoning

  13. Transcript-Supervised Post-Training of Generative Speech Enhancement on Real Recordings via Reinforce Adjoint Matching

    Sep 24, 2026Julius Richter, Christoph Boeddeker, Yoshiki Masuyama +4Speech EnhancementRL Post-Training

  14. Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD

    Sep 24, 2026Yibo Zhao, Zixuan Yang, Yunshi Lan +1Selective Knowledge DistillationOn-Policy Distillation

  15. RL Starts before RL: On Policy Distillation for Better Reinforcement Learning

    Sep 23, 2026Shuai Dong, Yongfu Zhu, Yuqi Xu +26Reinforcement LearningRL for Language Model Reasoning

  16. Reasoning-Preserving Fine-Tuning of Post-RL LLMs with Null-Basis LoRA

    Sep 22, 2026Wenzhi Fang, Nicholas Tzou, Lazar Valkov +1LLM Fine-TuningLow-Rank Adaptation

  17. Information-Time Proximal Policy Optimization

    Sep 21, 2026Yongcheng Zeng, Xinyu Cui, Yan Song +9Reinforcement LearningRL for Language Model Reasoning

  18. OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

    Sep 17, 2026Damiano Da Col, Maximilian Igl, Peter Karkus +5End-to-End Autonomous DrivingRL Post-Training

  19. Compositional Reasoning in Language Models under Reinforcement Learning Post-Training

    Sep 16, 2026Yu He, Yingxi Li, Yifei Wang +1Compositional ReasoningRL Post-Training

  20. CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents

    Sep 16, 2026Jiaxuan Jiang, Liyuan He, Zhixuan FangContinual Learning for LLM AgentsMulti-Agent Systems

  21. GrowMTP: Can RL Grow Its Own Draft Head?

    Sep 15, 2026Minghua He, Lingzhe Zhang, Yuan Liu +2Speculative DecodingLLM Inference Acceleration

  22. Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training

    Sep 14, 2026Yuanhao Yue, Qianli Ma, Chengyu Wang +3Multimodal Large Language ModelsCurriculum RL

  23. Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

    Sep 14, 2026Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma +1RL for Code GenerationOffline RL

  24. MInTRL: Off-policy Intervention can boost On-policy RL

    Sep 14, 2026Mingyu Chen, Yefan Tao, Gerald Friedland +2Reinforcement LearningReinforcement Learning with Verifiable Rewards

  25. Expert-Space Exploration in MoE Reinforcement Learning

    Sep 14, 2026Hongyi He, Zhenghao Lin, Xiao Liu +3Reinforcement LearningExpert Routing

  26. Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training

    Sep 9, 2026Junwon Ko, Dong-Jae Lee, Minchan Kwon +2Offline RLPreference Optimization