RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. GRPODropout: Less is More for Online Reinforcement Learning Rollouts

    Oct 8, 2026Hexuan Deng, Zihao Yan, Xuebo Liu +8Reinforcement LearningRL for Language Model Reasoning

  2. Residual Advantage: Student-Relative Teacher Guidance for RL with Verifiable Rewards

    Oct 8, 2026Xiaobing Chen, Zhiqi PangRL for Language Model ReasoningRL Post-Training

  3. Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization

    Oct 8, 2026Pengxin Guo, Shuang Zeng, Zonggen Li +3Federated RLRL for Language Model Reasoning

  4. RL-ARC: Calibrating Large Reasoning Models via Reasoning-guided Uncertainty

    Oct 8, 2026Gukhyeon Lee, SangKeun LeeLanguage Model CalibrationLLM Uncertainty Estimation

  5. SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning

    Oct 8, 2026Wei Yang, Shawn Li, Yuehan Qin +8Self-Evolving AgentsSynthetic Data Generation for Language Models

  6. Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL

    Oct 8, 2026Hanyu Wang, Nakul Agarwal, Hossein Nourkhiz Mahjoub +4LLM ReasoningRL for Language Model Reasoning

  7. Less from More: Reinforcing Sparse Video Reasoning from Dense References

    Oct 7, 2026Wenfang Sun, Yingjun Du, Cees G. M. SnoekVideo ReasoningVLM Reasoning

  8. Decoupling Exploration from Optimization in RLVR

    Oct 7, 2026Saif Punjwani, Micah GoldblumRL for Language Model ReasoningRL Exploration

  9. Coverage-Aware Reasoning with Medical Tokens for Diagnosis Prediction

    Oct 7, 2026Kaisong Zhang, Haotian Fang, Junmeng Zhou +3Medical LLMsClinical Prediction

  10. RollVerify: Bridging Efficiency and Accuracy in Long-Tail Rollout Reinforcement Learning

    Oct 7, 2026Yongqiang Yao, Jinru Tan, Kaihuan Liang +5RL for Language ModelsReinforcement Learning

  11. CERO: Where and When to Allocate Rollouts for RL Post-Training

    Oct 7, 2026Yiming Zong, Yige Wang, Xing Hu +2Reinforcement LearningRL Post-Training

  12. COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

    Oct 7, 2026Zicheng Hu, Zhijian Zhou, Xuan Zhang +7Asynchronous RLRL Post-Training

  13. Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

    Oct 6, 2026Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi +9Agentic RLRL for Language Model Reasoning

  14. Minimal Witness Reinforcement Learning

    Oct 5, 2026T. Y. Tsui, Zihao Ye, Pengxiang Cai +3RL for Language Model ReasoningCredit Assignment in RL

  15. Base Models Can Reason By Taking a Cue From Training Data

    Oct 5, 2026Sophie L. Wang, Amil Dravid, Rulin Shao +3LLM PromptingRL for Language Model Reasoning

  16. Transfer-Stratified On-Policy Distillation for RL-Improved Reasoning Teachers

    Oct 5, 2026Xiaoyu Chen, Bo Shao, Tiangang Zhu +5RL for Language Model ReasoningSelective Knowledge Distillation

  17. Learning to Simulate Individuals from Macro Social Signals

    Oct 5, 2026Yining Zhao, Bushi Liu, Haofei Yu +5Human Behavior SimulationRL for Language Model Reasoning

  18. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual UnderstandingRL for Language Model Reasoning

  19. On Language Drift during RLVR Post-Training

    Oct 1, 2026Michael Sullivan, Alexander KollerRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  20. Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

    Oct 1, 2026Qijia He, Ruinan Jin, Jun Luo +2Asynchronous RLRL for Language Model Reasoning

  21. Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning

    Oct 1, 2026Zihan Liu, Xurong XieLLM Reasoning with GraphsRL for Language Model Reasoning

  22. AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models

    Oct 1, 2026Yuxiang Wang, Kunyu Feng, Yuancheng Wang +12RL for Language Model ReasoningAudio Reasoning

  23. Rethinking Probability-Based Reinforcement Learning From Posterior Concentration

    Oct 1, 2026Shiu-Hong Kao, Yubo Zhao, Zhenyu Tian +3Reinforcement LearningRL for Language Model Reasoning

  24. Learning to Ask: Information Acquisition for SLM-LLM Collaboration, under a budget

    Oct 1, 2026Yongjun Kim, Xiaoxiao Li, Jaeho LeeRL for Language Model ReasoningEfficient Language Model Reasoning

  25. Does Scaling Reinforcement Learning Really Require More Training?

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongbo Ma +2RL for Language Model ReasoningRL Post-Training