RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics

    May 10, 2026Aishik Nagar, Arun-Kumar Kaliya-Perumal, Yu-Hsuan Han +5HealthcareClinical Decision Support

  2. DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

    May 9, 2026Yang Zhou, Can Jin, Zihan Dong +7Reinforcement LearningRL for Language Model Reasoning

  3. Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

    May 9, 2026Xingyuan Hua, Sheng Yue, Ju RenRL for Language Model ReasoningTest-Time Scaling

  4. Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

    May 9, 2026Dongcheng Zhang, Yi Zhang, Yuxin Chen +3LLM Self-CorrectionRL for Language Model Reasoning

  5. CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization

    May 9, 2026Soo Min Kwon, Ziteng Sun, Ananda Theertha Suresh +2RL for Language Model ReasoningGroup Relative Policy Optimization

  6. How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

    May 9, 2026Yifan Xu, Junren Chen, Yifan ChenRL for Language Model ReasoningPrompt Tuning

  7. The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

    May 9, 2026Tianhao Cheng, Zeyu Huang, Zihan Qiu +5Reinforcement LearningToken-Level Credit Assignment

  8. Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

    May 8, 2026Aswin RRV, Jacob Dineen, Divij Handa +4Synthetic Data GenerationRL for Language Model Reasoning

  9. AIPO: Learning to Reason from Active Interaction

    May 8, 2026Junnan Liu, Linhao Luo, Thuy-Trang Vu +1RL for Language Model ReasoningLLM-Guided RL

  10. Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

    May 8, 2026Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe +2Reinforcement LearningRL for Language Model Reasoning

  11. Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning

    May 8, 2026Zhicheng Yang, Zhijiang Guo, Yifan Song +5RL for Language Model ReasoningLanguage Model Distillation

  12. Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

    May 8, 2026Gengyang Li, Zheng-Fan Wu, Siqi Bao +1Token-Level Credit AssignmentRL for Language Model Reasoning

  13. Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

    May 8, 2026Yunho Choi, Jongwon Lim, Woojin Ahn +3Value Function EstimationRL for Language Model Reasoning

  14. ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

    May 8, 2026Tingcheng Bian, Yuzhe Zhang, Jing Jin +5Reward ShapingRL for Language Model Reasoning

  15. HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control

    May 8, 2026Xincheng Yao, Ruoqi Li, Cheng Chen +4RL for Language ModelsExploration-Exploitation Tradeoff

  16. Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

    May 8, 2026Yash Ingle, Jaival Chauhan, Ankit Yadav +1Reinforcement LearningRL for Language Model Reasoning

  17. Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

    May 8, 2026Tao Wang, Shuo Li, Yan Sun +2RL for Language Model ReasoningGroup Relative Policy Optimization

  18. Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

    May 7, 2026Tianle Wang, Zhaoyang Wang, Guangchen Lan +4Logical ReasoningRL for Language Model Reasoning

  19. Skip What You Can Predict: Predictive Repositioning for Policy Optimization for Efficient LLM Training

    May 7, 2026Ismam Nur Swapnil, Aranya Saha, Tasneea Zahra +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  20. Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

    May 7, 2026Nan Jia, Haojin Yang, Xing Ma +6RL for Language Model ReasoningLanguage Model Distillation

  21. Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

    May 7, 2026Qianjia Cheng, Yuchen Zhang, Zhilin Wang +9RL for Language Model ReasoningRL for Tool Use

  22. Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

    May 7, 2026Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger +1RL for Language Model ReasoningEfficient Language Model Reasoning

  23. Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

    May 7, 2026Yun Qu, Qi Wang, Yixiu Mao +11RL for Language Model ReasoningGroup Relative Policy Optimization

  24. Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

    May 7, 2026Chaoli Mou, Zhan Zhuang, Xinning Chen +1RL for Language Model ReasoningCredit Assignment in RL

  25. AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

    May 7, 2026Yang Xu, Kun Yao, Yiming Deng +3RL for Language Model ReasoningPolicy Optimization

  26. Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

    May 7, 2026Langlin Huang, Chengsong Huang, Jinyuan Li +3LLM PromptingRL for Language Model Reasoning

  27. ZAYA1-8B Technical Report

    May 6, 2026Robert Washbourne, Rishi Iyer, Tomas Figliolia +15Mixture-of-Experts Language ModelsRL for Language Model Reasoning

  28. Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers

    May 6, 2026Senkang Hu, Yong Dai, Xudong Han +4Agentic RLReinforcement Learning