RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

    Aug 5, 2026Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo +2RL for Language Model ReasoningSpeculative Decoding

  2. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

    Aug 4, 2026Changle Qu, Sunhao Dai, Hengyi Cai +4On-Policy Self-DistillationRL for Language Model Reasoning

  3. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

    Aug 4, 2026Jinhe Bi, Chennan Zhou, Zengjie Jin +10RL for Language Model ReasoningRL Post-Training

  4. Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

    Aug 4, 2026Kunbin Xu, Xingzuo Li, Xuefeng Bai +1RL for Language Model ReasoningTest-Time RL

  5. Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

    Aug 4, 2026Yongshi Ye, Liang Zhang, Yidong Chen +2RL for Language Model ReasoningGroup Relative Policy Optimization

  6. PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

    Aug 4, 2026Yongshi Ye, Biao Fu, Chongxuan Huang +2RL for Language Model ReasoningProcess Supervision

  7. CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

    Aug 4, 2026Ziqi Jia, Yalu Ouyang, Bo Pang +5Numerical Reasoning in Language ModelsRL for Language Model Reasoning

  8. BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

    Aug 3, 2026Soumadeep Saha, Krish Sharma, Akshay Chaturvedi +1Reasoning DiversityRL for Language Model Reasoning

  9. Start Classifying: Categorical Critics for LLM Reinforcement Learning

    Aug 3, 2026Zhijian Zhou, Long Li, Xuan Zhang +7RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  10. Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

    Aug 3, 2026Yijun Zhang, Yule Xie, Jiaxin Ding +4RL for Language Model ReasoningPolicy Optimization

  11. Self-Improving Large Language Models via Progressive Experience Evolution

    Aug 3, 2026Shijie Ren, Xiting Wang, Meng Li +8RL for Language Model ReasoningLanguage Model Self-Improvement

  12. Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy

    Aug 3, 2026Jim Dilkes, Vahid Yazdanpanah, Sebastian SteinRL for Language Model ReasoningRL Post-Training

  13. AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

    Aug 3, 2026Jingqi Tian, Haoji Zhang, Lin Chen +7Efficient VLM InferenceRL for Language Model Reasoning

  14. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1RL for Language Model ReasoningRL for Diffusion Models

  15. Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

    Aug 3, 2026Xuyang Zhao, Liting Zhang, Zichen Xu +4Numerical Reasoning in Language ModelsRL for Language Model Reasoning

  16. Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

    Aug 2, 2026Wenhao Zhang, Yibo Xie, Rui Wang +9Reinforcement LearningRL for Language Model Reasoning

  17. Gaokerena: A Small Persian Medical Language Model Family

    Aug 2, 2026Mehrdad Ghassabi, Hamidreza Baradaran Kashani, Pedram Rostami +5RL for Language Model ReasoningSmall Language Models

  18. Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

    Aug 1, 2026Zhuowen Han, Jinwei Xiao, Zhengxi Lu +9Self-Training for Language ModelsRL for Language Model Reasoning

  19. Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation

    Jul 31, 2026Yongshi Ye, Biao Fu, Chongxuan Huang +2RL for Language Model ReasoningEfficient Language Model Inference

  20. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    Jul 31, 2026Xinyan Guan, Jiali Zeng, Chunlei Xin +5Overthinking in Language ModelsRL for Language Model Reasoning

  21. SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

    Jul 31, 2026Yifan Ding, Xincheng Wei, Yoshua Y. Li +7RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  22. ββ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    Jul 30, 2026Jiawei Xu, Minghui Liu, Juzheng Zhang +2KL-Regularized RLOn-Policy Self-Distillation

  23. SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute

    Jul 30, 2026Hongyu Chen, Liang Lin, Guangrun WangRL for Language Model ReasoningLanguage Model Self-Assessment

  24. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Jul 30, 2026Qiangqiang He, Zhongheng Wu, ZiJian WangToken-Level Credit AssignmentRL for Language Model Reasoning