RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

    May 11, 2026Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken +2Diffusion Model AlignmentFlow Matching

  2. What should post-training optimize? A test-time scaling law perspective

    May 11, 2026Muheng Li, Jian Qian, Wenlong MouTest-Time ScalingBest-of-N Sampling

  3. Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

    May 11, 2026Xuexiang Wen, Hang Yu, Linchao Zhu +1Intrinsic Reward MethodsReinforcement Learning

  4. Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

    May 11, 2026Changhao Li, Yuchen Zhuang, Chenxiao Gao +4RL for Language ModelsInference-Time Optimization

  5. ξξ-DPO: Direct Preference Optimization via Ratio Reward Margin

    May 9, 2026Zhengyuan Fan, Zhonghua Wu, Yuxuan Du +1Pairwise Preference LearningDirect Preference Optimization

  6. Reinforcement Learning for Scalable and Trustworthy Intelligent Systems

    May 8, 2026Guangchen LanFederated RLPrivacy-Preserving Language Models

  7. Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

    May 8, 2026Gengyang Li, Zheng-Fan Wu, Siqi Bao +1Token-Level Credit AssignmentRL for Language Model Reasoning

  8. Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

    May 8, 2026Chen Wang, Hexuan Deng, Yining Zhang +5Overthinking in Language ModelsReinforcement Learning with Verifiable Rewards

  9. Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

    May 8, 2026Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3RL for Language ModelsReinforcement Learning

  10. Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

    May 8, 2026Pingbang Hu, Xueshen Liu, Z. Morley Mao +1Supervised Fine-TuningTraining Data Selection

  11. How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

    May 7, 2026Rui Zhu, Weiheng Bai, Qiushi Wu +3LLM AlignmentKV-Cache Compression

  12. A2^2TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

    May 7, 2026Dingwei Chen, Zefang Zong, Zhipeng Ma +5Credit Assignment in RLPolicy Gradient Methods

  13. Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

    May 7, 2026Yun Qu, Qi Wang, Yixiu Mao +11RL for Language Model ReasoningGroup Relative Policy Optimization

  14. Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

    May 7, 2026Yujia Chen, Yang Ye, Xiao Chu +2RL for Code GenerationReinforcement Learning

  15. CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies

    May 6, 2026Keyu Chen, Nanfei Ye, Yida Wang +4Reinforcement LearningAutonomous Driving Planning

  16. Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models

    May 4, 2026Inoussa Mouiche, Abderaouf BahiLLM AlignmentDirect Preference Optimization

  17. Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism

    May 3, 2026Long Zhao, Qinghe Wang, Jiaan Zhu +5Tensor ParallelismLLM Inference Acceleration

  18. Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies

    May 1, 2026Yi Wang, Xinchen Li, Pengwei Xie +13Robot Policy LearningRobotic Manipulation

  19. Exploration Hacking: Can LLMs Learn to Resist RL Training?

    Apr 30, 2026Eyon Jang, Damon Falck, Joschka Braun +6RL ExplorationLLM Safety

  20. Co-Evolving Policy Distillation

    Apr 29, 2026Naibin Gu, Chenxu Yang, Qingyi Si +7Reinforcement Learning with Verifiable RewardsMulti-Teacher Knowledge Distillation

  21. Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

    Apr 29, 2026Bolian Li, Yifan Wang, Yi Ding +3RL for Language ModelsReinforcement Learning

  22. Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models

    Apr 27, 2026Dan Shi, Zhuowen Han, Simon Ostermann +3Reinforcement LearningRL for Language Model Reasoning