RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

    Apr 18, 2026Yifu Huo, Chenglong Wang, Ziming Zhu +9Reinforcement LearningRL for Language Model Reasoning

  2. Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

    Apr 18, 2026Benteng Chen, Weida Wang, Shufei Zhang +2RL for Language Model ReasoningLLM Inference Acceleration

  3. Learning to Reason with Insight for Informal Theorem Proving

    Apr 17, 2026Yunhe Li, Hao Shi, Bowen Deng +8Automated Theorem ProvingRL for Language Model Reasoning

  4. Beyond Distribution Sharpening: The Importance of Task Rewards

    Apr 17, 2026Sarthak Mittal, Leo Gagnon, Guillaume LajoieReinforcement LearningRL for Language Model Reasoning

  5. AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency

    Apr 17, 2026Max Henning Höth, Kristian Kersting, Björn Deiseroth +1CoT FaithfulnessFeature Attribution

  6. AgentV-RL: Scaling Reward Modeling with Agentic Verifier

    Apr 17, 2026Jiazheng Zhang, Ziche Fu, Zhiheng Xi +13Reward ModelingRL for Language Model Reasoning

  7. Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning

    Apr 17, 2026Yangyi Fang, Jiaye Lin, Xiaoliang Fu +2RL for Language Model ReasoningLLM Mathematical Reasoning

  8. LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

    Apr 16, 2026Lukas Helff, Quentin Delfosse, David Steinmann +6Reward HackingLogical Reasoning

  9. LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

    Apr 16, 2026Bowen Ping, Zijun Chen, Tingfeng Hui +4Reinforcement LearningRL for Language Model Reasoning

  10. Targeted Exploration via Unified Entropy Control for Reinforcement Learning

    Apr 16, 2026Chen Wang, Lai Wei, Yanzhi Zhang +5Reinforcement LearningRL for Language Model Reasoning

  11. Policy Improvement Reinforcement Learning

    Apr 1, 2026Huaiyang Wang, Xiaojie Li, Xiaohan Wang +10RL for Language ModelsRL for Language Model Reasoning

  12. RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

    Apr 1, 2026Shaopeng Fu, Xingxing Zhang, Li Dong +1RL for Code GenerationLLM Self-Refinement

  13. Learning Diagnostic Reasoning for Decision Support in Toxicology

    Mar 31, 2026Nico Oberländer, David Bani-Harouni, Tobias Zellner +3Clinical Decision SupportRL for Language Model Reasoning

  14. P^2O: Joint Policy and Prompt Optimization

    Mar 23, 2026Xinyu Lu, Kaiqi Zhang, Jinglin Yang +6RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  15. PA3: Policy-Aware Agent Alignment through Chain-of-Thought

    Mar 15, 2026Shubhashis Roy Dipta, Daniel Bis, Kun Zhou +4LLM AlignmentRL for Language Model Reasoning

  16. MIND: Unified Inquiry and Diagnosis RL with Criteria Grounded Clinical Supports for Psychiatric Consultation

    Mar 4, 2026Guoyi Li, Shihao Xu, Jiatong Ma +4HealthcareEvidence-Grounded Reasoning

  17. Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

    Feb 26, 2026Chris Samarinas, Haw-Shiuan Chang, Hamed ZamaniReinforcement LearningProcess Reward Models

  18. Adaptive Time Series Reasoning via Segment Selection

    Feb 20, 2026Shvat Messica, Jiawen Zhang, Kevin Li +2Time Series ReasoningTime Series QA

  19. On the Emergence of Implicit Curriculum in RLVR Learning Dynamics

    Feb 16, 2026Yu Huang, Zixin Wen, Yuejie Chi +4RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  20. Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

    Feb 14, 2026Yanbo Wang, Minzheng Wang, Jian Liang +3LLM AlignmentRL for Language Model Reasoning

  21. Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

    Feb 10, 2026Pei-Chi Pan, Yingbin Liang, Sen LinReward ModelingReward Hacking

  22. rePIRL: Learn PRM with Inverse RL for LLM Reasoning

    Feb 8, 2026Xian Wu, Kaijie Zhu, Ying Zhang +2Reinforcement LearningProcess Reward Models

  23. F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

    Feb 6, 2026Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov +4Reinforcement LearningRL for Language Model Reasoning

  24. An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models

    Feb 6, 2026Xinxin Lin, Guangxin Dai, Yi Zhong +25HealthcareMental Health

  25. The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

    Feb 6, 2026Yingru Li, Jiawei Xu, Ziniu Li +10RL for Language Model ReasoningPolicy Gradient Methods

  26. Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

    Feb 5, 2026Zhiqi Yu, Zhangquan Chen, Mengting Liu +2RL for Language Model ReasoningGroup Relative Policy Optimization