RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

    May 27, 2026Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali +1Reinforcement LearningRL for Language Model Reasoning

  2. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL

  3. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuCredit Assignment in RLStep-Level Credit Assignment in RL

  4. Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks

    May 26, 2026Yihua Zhu, Qianying Liu, Fei Cheng +4Logical ReasoningAbductive Reasoning

  5. GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training

    May 25, 2026Yuelin Hu, Zhenbo Yu, Zhengxue Cheng +2Supervised Fine-TuningAdaptive Loss Weighting

  6. Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

    May 24, 2026Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng +2Reinforcement LearningRL for Language Model Reasoning

  7. Vector Policy Optimization: Training for Diversity Improves Test-Time Search

    May 21, 2026Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld +6Multi-Objective Reinforcement LearningReinforcement Learning

  8. F-TIS: Harnessing Diverse Models in Collaborative GRPO

    May 21, 2026Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer +1RL for Language ModelsCommunication-Efficient Distributed Training

  9. Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

    May 20, 2026Zheyuan Zhang, Kaiwen Shi, Han Bao +3RL for Language Model ReasoningPolicy Optimization

  10. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1RL for Language ModelsPolicy Gradient

  11. You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

    May 20, 2026Zhepei Wei, Xinyu Zhu, Wei-Lin Chen +3RL for Language Model ReasoningLow-Rank Approximation

  12. Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

    May 19, 2026Chongyu Fan, Gaowen Liu, Mingyi Hong +2Muon OptimizerVision-Language-Action Models

  13. FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

    May 18, 2026Xikai Zhang, Yongzhi Li, Likang Xiao +6RL for Language Model ReasoningRL Exploration

  14. Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

    May 16, 2026Peng Cui, Boyao Yang, Jun ZhuRL for Language Model ReasoningRL Post-Training

  15. Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

    May 16, 2026Peng Cui, Boyao Yang, Jun ZhuMultimodal RobustnessVLM Reasoning

  16. DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts

    May 14, 2026Jiading Gai, Shuai Zhang, Xiang Song +2GPU AccelerationSelf-Attention

  17. Dynamic Latent Routing

    May 14, 2026Fangyuan Yu, Xin Su, Amir AbdullahLatent Action LearningRL Post-Training

  18. Diagnosing Training Inference Mismatch in LLM Reinforcement Learning via a Zero-Mismatch Reference

    May 14, 2026Tianle Zhong, Neiwen Ling, Yifan Pi +5Reinforcement LearningLLM Inference

  19. Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

    May 13, 2026Feng Zhang, Xinhong Ma, Ziqiang Dong +5RL for Language Model ReasoningGroup Relative Policy Optimization

  20. Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation

    May 12, 2026Yuwei Zhang, Sha Li, Changlong Yu +9Continual Learning for LLMsSelf-Distillation

  21. Variance-aware Reward Modeling with Anchor Guidance

    May 12, 2026Shuxing Fang, Ruijian Han, Liangyu Zhang +1Pairwise Preference LearningReward Modeling

  22. Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

    May 11, 2026Haoyuan Sun, Jing Wang, Yuxin Song +9Reward HackingPreference Optimization

  23. RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

    May 11, 2026Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang +9Reinforcement LearningRubric-Based RL