RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

    May 13, 2026Feng Zhang, Xinhong Ma, Ziqiang Dong +5RL for Language Model ReasoningGroup Relative Policy Optimization

  2. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2RL for Language ModelsReinforcement Learning

  3. Multi-Rollout On-Policy Distillation via Peer Successes and Failures

    May 12, 2026Weichen Yu, Xiaomin Li, Yizhou Zhao +8RL for Language Model ReasoningLanguage Model Distillation

  4. Learning, Fast and Slow: Towards LLMs That Adapt Continually

    May 12, 2026Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal +6Continual Learning for LLMsRL for Language Model Reasoning

  5. Holder Policy Optimisation

    May 12, 2026Yuxiang Chen, Dingli Liang, Yihang Chen +8RL for Language Model ReasoningGroup Relative Policy Optimization

  6. StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

    May 12, 2026Hao Wang, Rui Li, Lei Sha +1RL for Language Model ReasoningExecution-Guided Code Generation

  7. GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

    May 12, 2026Sijia Li, Yuchen Huang, Zifan Liu +7RL for Language Model ReasoningCredit Assignment in RL

  8. Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

    May 12, 2026Jiazheng Zhang, Ziche Fu, Junrui Shen +17RL for Language Model ReasoningPolicy Optimization

  9. Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

    May 12, 2026Chi Zhang, Haibo Qiu, Qiming Zhang +3RL for Language Model ReasoningAdversarial Attacks on LLMs

  10. Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

    May 12, 2026Zhaomeng Zhou, Lan Zhang, Junyang Wang +2RL for Language Model ReasoningEfficient Language Model Reasoning

  11. Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

    May 12, 2026Guobin Shen, Xiang Cheng, Chenxiao Zhao +4On-Policy Self-DistillationRL for Language Model Reasoning

  12. Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

    May 12, 2026Cheng Wang, Qin Liu, Wenxuan Zhou +1Reinforcement LearningRL for Language Model Reasoning

  13. Selective Off-Policy Reference Tuning with Plan Guidance

    May 12, 2026Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen +2Reinforcement LearningRL for Language Model Reasoning

  14. Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

    May 12, 2026Huimin Xu, Shuai Zhao, Xiaobao Wu +1Reinforcement LearningRL for Language Model Reasoning

  15. Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

    May 11, 2026Han Zheng, Yining Ma, Karthick Gunasekaran +4Reinforcement LearningMeta-Learning

  16. TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

    May 11, 2026George Wu, Nan Jing, Qing Yi +7Multi-Agent LLM SystemsRL for Language Model Reasoning

  17. ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

    May 11, 2026Wanghan Xu, Yuhao Zhou, Hengyuan Zhao +8LLM SycophancyScientific Reasoning

  18. Relative Score Policy Optimization for Diffusion Language Models

    May 11, 2026Zichao Yu, Shengze Xu, Bingqing Jiang +2RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  19. STEPS: Selective On-Policy Self-Distillation for Reasoning

    May 11, 2026Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen +2On-Policy Self-DistillationRL for Language Model Reasoning

  20. Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

    May 11, 2026Xuexiang Wen, Hang Yu, Linchao Zhu +1Intrinsic Reward MethodsReinforcement Learning

  21. Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

    May 11, 2026Changhao Li, Yuchen Zhuang, Chenxiao Gao +4RL for Language ModelsInference-Time Optimization

  22. LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

    May 10, 2026Songtao Wei, Yi Li, Zhikai Li +7RL for Language Model ReasoningEfficient Language Model Reasoning