RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance

    May 6, 2026Song Yu, Li Li, Wenwen Zhao +1RL for Language Model ReasoningGroup Relative Policy Optimization

  2. Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games

    May 6, 2026Yidong He, Yutao Lai, Pengxu Yang +4Game-Playing AgentsRL for Language Model Reasoning

  3. Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation

    May 6, 2026Akiyoshi Tomihari, Issei SatoReinforcement LearningKL-Regularized RL

  4. Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

    May 5, 2026Tianyang Han, Hengyu Shi, Junjie Hu +3RL for Code GenerationProcess Reward Models

  5. DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

    May 5, 2026Hongbo Jin, Rongpeng Zhu, Zhongjing Du +4Token-Level Credit AssignmentRL for Language Model Reasoning

  6. HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness

    May 4, 2026Jianing Wang, Linsen Guo, Zhengyu Chen +8RL for Language Model ReasoningTest-Time Scaling

  7. Towards Understanding Specification Gaming in Reasoning Models

    May 4, 2026Kei Nishimura-Gasparian, Robert McCarthy, David LindnerReward HackingRL for Language Model Reasoning

  8. Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

    May 3, 2026Arash Ahmadi, Sarah Sharif, Yaser +1Reinforcement LearningLarge Language Model-Guided Optimization

  9. Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards

    May 3, 2026Rudray Dave, Vedang Dubey, Smit Deoghare +1Reinforcement LearningRL for Language Model Reasoning

  10. Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

    May 2, 2026Yunhan Bu, Quan Zhang, Huaping Zhang +9Structural Causal ModelsRL for Language Model Reasoning

  11. Segment-Aligned Policy Optimization for Multi-Modal Reasoning

    May 2, 2026Lei Gao, Zhuoming Li, Mengxi Jia +4RL for Language Model ReasoningPolicy Optimization

  12. ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

    May 1, 2026Zihan Lin, Xiaohan Wang, Jie Cao +6RL for Language ModelsReinforcement Learning

  13. Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

    May 1, 2026Anamika Lochab, Bolian Li, Ruqi ZhangRL for Language Model ReasoningGroup Relative Policy Optimization

  14. RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners

    Apr 30, 2026Jugal Gajjar, Kamalasankari SubramaniakuppusamyTable QALLM Grounding

  15. Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning

    Apr 30, 2026Shijin Gong, Kai Ye, Jin Zhu +3Value Function EstimationRL for Language Model Reasoning

  16. Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning

    Apr 30, 2026Jingcheng Deng, Zihao Wei, Liang Pang +4Reinforcement LearningRL for Language Model Reasoning

  17. Distributional Alignment Games for Answer-Level Fine-Tuning

    Apr 29, 2026Mehryar Mohri, Jon Schneider, Yifan WuFine-TuningRL for Language Model Reasoning

  18. Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

    Apr 29, 2026Bolian Li, Yifan Wang, Yi Ding +3RL for Language ModelsReinforcement Learning

  19. One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

    Apr 28, 2026Yixiao Zhou, Dongzhou Cheng, zhiliang wu +3LLM AlignmentRL for Language Model Reasoning

  20. JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

    Apr 28, 2026Xinjie Chen, Biao Fu, Jing Wu +4RL for Language Model ReasoningMathematical Reasoning

  21. Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models

    Apr 27, 2026Dan Shi, Zhuowen Han, Simon Ostermann +3Reinforcement LearningRL for Language Model Reasoning

  22. Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning

    Apr 27, 2026Dong Liu, Yanxuan Yu, Ying Nian WuCoT ReasoningLarge Language Model-Guided Optimization

  23. IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

    Apr 27, 2026Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand +8Cross-Lingual Reasoning in Language ModelsRL for Language Model Reasoning

  24. Stabilizing Efficient Reasoning with Step-Level Advantage Selection

    Apr 27, 2026Han Wang, Xiaodong Yu, Jialian Wu +4RL for Language Model ReasoningEfficient Language Model Reasoning

  25. SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

    Apr 26, 2026Alexis Limozin, Eduard Durech, Torsten Hoefler +2RL for Language Model ReasoningPolicy Optimization

  26. Language as a Latent Variable for Reasoning Optimization

    Apr 23, 2026Linjuan Wu, Haoran Wei, Jialong Tang +4Multilingual Language ModelsCross-Lingual Reasoning in Language Models