RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Distilled Reinforcement Learning for LLM Post-training

    Jul 19, 2026Chen Wang, Zhaochun Li, Jionghao Bai +4RL for Language Model ReasoningCross-Architecture Knowledge Distillation

  2. LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

    Jul 19, 2026Xingjian Tao, Yiwei Wang, Yujun Cai +1Visual Spatial ReasoningReward Shaping

  3. Understanding Reasoning from Pretraining to Post-Training

    Jul 17, 2026Jingyan Shen, Ang Li, Salman Rahman +4Language Model PretrainingRL for Language Model Reasoning

  4. Mask-Aware Policy Gradients for Diffusion Language Models

    Jul 16, 2026Haran Raajesh, Kulin Shah, Adam Klivans +1Masked Diffusion ModelsRL for Language Model Reasoning

  5. On-Policy Delta Distillation

    Jul 16, 2026Byeongho Heo, Jaehui Hwang, Sangdoo Yun +1RL for Language Model ReasoningLanguage Model Distillation

  6. Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

    Jul 16, 2026Weiwen Xu, Jia Liu, Hou Pong Chan +4RL for Language Model ReasoningPolicy Optimization

  7. A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

    Jul 16, 2026Zikun Zhang, Jiayuan Sheng, David D. Yao +1Masked Diffusion ModelsRL for Language Model Reasoning

  8. Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

    Jul 15, 2026Rui Wang, Hongru Wang, Yi Chen +4RL for Language Model ReasoningLanguage Model Distillation

  9. GFlowRL: Scaling Distribution-Matching RL to Large Language Models

    Jul 15, 2026Xiaodong Liu, Michael Xu, Jack W. Stokes +3RL for Code GenerationReinforcement Learning

  10. Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

    Jul 14, 2026Takumi Shioda, Kohei Terashima, Tatsuo NagaiRL for Language Model ReasoningBuilding Energy Management

  11. Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

    Jul 14, 2026Xinyu Tang, Qianggang Cao, Yurou Liu +13RL for Language ModelsRL for Language Model Reasoning

  12. SCOPE-RL: Optimizing Reasoning Paths Before and After Success

    Jul 13, 2026Xiaojian Liu, Han Xu, Jianqiang Xia +6Reward ShapingRL for Language Model Reasoning

  13. ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

    Jul 11, 2026Kexin Huang, Junkang Wu, Jinda Lu +7Reinforcement LearningKL-Regularized RL

  14. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    Jul 11, 2026Zhicheng Cai, Xinyuan Guo, Hanlin Wu +3Reinforcement LearningRL for Language Model Reasoning

  15. Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

    Jul 9, 2026Yiyang Fang, Pei Fu, Jinjie Li +7Efficient Multimodal InferenceRL for Language Model Reasoning

  16. RL Post-Training Builds Compositional Reasoning Strategies

    Jul 8, 2026Azwar Abdulsalam, Nishil Patel, Andrew SaxeCompositional ReasoningRL for Language Model Reasoning

  17. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Jul 8, 2026Chongyu Fan, Pengfei Liu, Jingjia Huang +2RL for Language Model ReasoningPolicy Optimization

  18. Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization

    Jul 7, 2026Kaishen Wang, Tong Zheng, Xuehao Cui +3LLM Hallucination MitigationRL for Language Model Reasoning

  19. Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation

    Jul 6, 2026Muhammad Zain Amin, Kibele Sebnem YildirimReinforcement LearningRL for Language Model Reasoning

  20. Weak-to-Strong Generalization via Direct On-Policy Distillation

    Jul 6, 2026Shiyuan Feng, Huan-ang Gao, Haohan Chi +7RL for Language Model ReasoningWeak-to-Strong Generalization

  21. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10RL for Language Model ReasoningLLM-Guided RL

  22. On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

    Jul 5, 2026Chee Heng Tan, Zhuoyi Lin, Mehul Motani +1Reward HackingConfidence Estimation in Language Models

  23. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning