RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. GRPODropout: Less is More for Online Reinforcement Learning Rollouts

    Oct 8, 2026Hexuan Deng, Zihao Yan, Xuebo Liu +8Reinforcement LearningRL for Language Model Reasoning

  2. Residual Advantage: Student-Relative Teacher Guidance for RL with Verifiable Rewards

    Oct 8, 2026Xiaobing Chen, Zhiqi PangRL for Language Model ReasoningRL Post-Training

  3. How to post-train on a surrogate: Envelope sampling mitigates reward hacking

    Oct 8, 2026Sanjit Dandapanthula, Shuvom Sadhuka, Samir Khan +3RL Post-TrainingReward Hacking

  4. Measuring and Mitigating Solution Mode Collapse in RLVR

    Oct 8, 2026Liv G. d'Aliberti, Marwa Abdulhai, Sofiia Druchyna +2Mode CollapseRL Post-Training

  5. CERO: Where and When to Allocate Rollouts for RL Post-Training

    Oct 7, 2026Yiming Zong, Yige Wang, Xing Hu +2Reinforcement LearningRL Post-Training

  6. COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

    Oct 7, 2026Zicheng Hu, Zhijian Zhou, Xuan Zhang +7Asynchronous RLRL Post-Training

  7. TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

    Oct 6, 2026Xin Wang, Hao Yu, Zhengyang Zhuge +9LLM QuantizationQuantization-Aware Training

  8. What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training

    Oct 5, 2026Subham Rath, Raj Dandekar, Rajat Dandekar +1LLM EvaluationLanguage Model Generation Evaluation

  9. Structuring MoE Expert Selection for Agentic Reinforcement Learning

    Oct 5, 2026Bolian Li, Ting-Yao Hu, Cheng-Yu Hsieh +3Agentic RLExpert Routing

  10. ThunderSyncRL: Lossless Acceleration of Agentic Reinforcement Learning

    Oct 5, 2026Seil Kang, Hangoo Kang, Tarun Suresh +4Agentic RLOn-Policy Distillation

  11. Erased, Rerouted, or Rescaled? Post-Training and the Causal Quotient of a Language Model's Belief State

    Oct 4, 2026Weihan Li, Tianshi Zheng, Junhao Wu +1Belief Updating in LLMsRL Post-Training

  12. R2R^2-WAM: Repair-and-Reject Post-Training for World Action Models

    Oct 4, 2026Ruiyan Xu, Haisheng Su, Sixu Lin +4World Action ModelsAction-Conditioned World Models

  13. Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

    Oct 1, 2026Qijia He, Ruinan Jin, Jun Luo +2Asynchronous RLRL for Language Model Reasoning

  14. Sharpening Tax in Post-Training

    Oct 1, 2026Changdae Oh, Qi Zeng, Qi Qi +7Agentic RLTest-Time Scaling

  15. Rethinking Probability-Based Reinforcement Learning From Posterior Concentration

    Oct 1, 2026Shiu-Hong Kao, Yubo Zhao, Zhenyu Tian +3Reinforcement LearningRL for Language Model Reasoning

  16. Does Scaling Reinforcement Learning Really Require More Training?

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongbo Ma +2RL for Language Model ReasoningRL Post-Training

  17. No Task Vector Is an Island: A Comprehensive Study on the Composability of Task Vectors from On-Policy Distillation

    Sep 30, 2026Jingang Zhou, Feiyu Han, Han Zhu +6Task VectorsTask Vector Merging

  18. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1RL for Language Model ReasoningCredit Assignment in RL

  19. PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

    Sep 30, 2026Yangang Zou, Jiajun Lu, Weitao Zhou +6Credit Assignment in RLStep-Level Credit Assignment in RL

  20. Mitigating the Length-Scaling Tax with Online Distillation

    Sep 30, 2026Xu Wan, Wenyue Xu, Shengjie Zhao +1RL for Language Model ReasoningOn-Policy Distillation

  21. What Pretraining and Midtraining Make Learnable from Rewards?

    Sep 29, 2026Chiwun Yang, Xiaoyu LiRL for Language Model ReasoningContinued Pretraining

  22. HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent

    Sep 29, 2026Zhangquan Chen, Yaoxin Niu, Xiang An +5Human-in-the-Loop AnnotationProcess Supervision

  23. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation