RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning

    May 18, 2026Zhanyue Qin, Jia Feng, Yibo Lyu +4Reinforcement LearningRL for Language Model Reasoning

  2. Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

    May 18, 2026Junyao Yang, Chen Qian, Kun Wang +4LLM InterpretabilityRL for Language Model Reasoning

  3. Self-Supervised On-Policy Distillation for Reasoning Language Models

    May 17, 2026Zhiquan Tan, Yinrong HongRL for Language Model ReasoningProcess Supervision

  4. Leveraging Error Diversity in Group Rollouts for Reinforcement Learning

    May 17, 2026Wenpu Liu, Yuqi Xu, Weichu Xie +8Reward ShapingRL for Language Model Reasoning

  5. Reasoning Before Diagnosis: Physician-Inspired Structured Thinking for ECG Classification

    May 17, 2026Yang Wu, Xiaoyan Yuan, Hau-San Wong +1RL for Language Model ReasoningElectrocardiogram Classification

  6. DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

    May 17, 2026Shaobo Wang, Yujie Chen, Yafeng Sun +9Reinforcement LearningRL for Language Model Reasoning

  7. D2^2Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning

    May 16, 2026Ru Zhang, Renda Li, Ziyu Ma +4RL for Language Model ReasoningCurriculum RL

  8. Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

    May 16, 2026Peng Cui, Boyao Yang, Jun ZhuRL for Language Model ReasoningRL Post-Training

  9. The Unlearnability Phenomenon in RLVR for Language Models

    May 16, 2026Yulin Chen, He He, Chen ZhaoReinforcement LearningRL for Language Model Reasoning

  10. PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

    May 16, 2026Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf +3Self-Play RLRL for Language Model Reasoning

  11. Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

    May 14, 2026Mengjie Ren, Jie Lou, Boxi Cao +6RL for Code GenerationLLM Self-Correction

  12. Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

    May 13, 2026Marius S. Knorr, Robert Müller, Jan P. Bremer +1HealthcareRL for Language Model Reasoning

  13. STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

    May 13, 2026Junjie Zhang, Guozheng Ma, Shunyu Liu +5RL for Language Model ReasoningProcess Supervision

  14. Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

    May 13, 2026Yafu Li, Runzhe Zhan, Haoran Zhang +25RL for Language Model ReasoningLLM Mathematical Reasoning

  15. Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning

    May 13, 2026Junlong Ke, Zichen Wen, Weijia Li +2On-Policy Self-DistillationRL for Language Model Reasoning

  16. Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence

    May 13, 2026Xinyu Liu, Kechen Jiao, Chunyang Xiao +10RL for Language Model ReasoningPolicy Optimization

  17. TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

    May 13, 2026Zeyu Zhang, Bradly C. StadieLLM EvaluationRL for Language Model Reasoning