RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

    May 21, 2026Yuchun Fan, Bei Li, Peiguang Li +9Multilingual Language ModelsReinforcement Learning

  2. Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

    May 21, 2026Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu +4Reinforcement LearningSelf-Play RL

  3. CLORE: Content-Level Optimization for Reasoning Efficiency

    May 21, 2026Yuyang Wu, Qiyao Xue, Guanxing Lu +4RL for Language Model ReasoningEfficient Language Model Reasoning

  4. Reinforced Graph of Thoughts: RL-Driven Adaptive Prompting for LLMs

    May 21, 2026Manuel Noah Riesen, Peter Alfred von NiederhäusernLLM Reasoning with GraphsLLM Prompting

  5. From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

    May 21, 2026Xitai Jiang, Zihan Tang, Wenze Lin +3RL for Language Model ReasoningCredit Assignment in RL

  6. Reasoning through Verifiable Forecast Actions: Consistency-Grounded RL for Financial LLMs

    May 21, 2026Jialin Chen, Aosong Feng, Harshit Verma +7Time Series ReasoningRL for Language Model Reasoning

  7. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1Value Function EstimationToken-Level Credit Assignment

  8. Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

    May 20, 2026Zheyuan Zhang, Kaiwen Shi, Han Bao +3RL for Language Model ReasoningPolicy Optimization

  9. You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

    May 20, 2026Zhepei Wei, Xinyu Zhu, Wei-Lin Chen +3RL for Language Model ReasoningLow-Rank Approximation

  10. DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

    May 20, 2026Kaiyi Zhang, Wei Wu, Yankai LinPolicy GradientToken-Level Credit Assignment

  11. How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

    May 20, 2026Richa Verma, Balaraman RavindranDirect Preference OptimizationRL for Language Model Reasoning

  12. Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

    May 20, 2026Xixiang He, Qiyao Sun, Ao Cheng +5RL for Language Model ReasoningGroup Relative Policy Optimization

  13. AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

    May 20, 2026Miaobo Hu, Shuhao Hu, Bokun Wang +5RL for Language Model ReasoningGroup Relative Policy Optimization

  14. OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind

    May 19, 2026Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi +2Cognitive ModelingTheory of Mind

  15. LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

    May 19, 2026Yanyu Chen, Jiyue Jiang, Dianzhi Yu +8RL for Language Model ReasoningProcess Supervision

  16. Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

    May 19, 2026Xiaozhe Li, Yang Li, Xinyu Fang +10KL-Regularized RLRL for Language Model Reasoning

  17. CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

    May 19, 2026Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed +4Token-Level Credit AssignmentRL for Language Model Reasoning

  18. When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

    May 19, 2026Yuchun Miao, Sen Zhang, Yuqi Zhang +4RL for Language Model ReasoningPolicy Optimization

  19. Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning

    May 19, 2026Shuyu Wei, Jian Sun, Delai Qiu +6RL for Language Model ReasoningLLM Reasoning

  20. AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

    May 18, 2026Zhenlin Wei, Pu Jian, Yingzhuo Deng +6Token-Level Credit AssignmentRL for Language Model Reasoning

  21. FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

    May 18, 2026Xikai Zhang, Yongzhi Li, Likang Xiao +6RL for Language Model ReasoningRL Exploration

  22. Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains

    May 18, 2026Zhonghang Yuan, Zhefan Wang, Fang Hu +7RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards