RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Improving Math Reasoning through Value-guided Informative Search

    Oct 1, 2026Shaohuai Liu, Yuning Wu, Haoran Liu +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  2. Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It

    Oct 1, 2026Jonathan Williams, Esin Tureci Karthik R. NarasimhanRL for Language Model ReasoningLow-Rank Adaptation

  3. Sharpen Before You Adapt: Data-Free Entry-State Sharpening for Test-Time Reinforcement Learning

    Oct 1, 2026Zhanming Zhang, Vinoth SelvendranRL for Language Model ReasoningTest-Time RL

  4. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2RL for Language Model ReasoningGroup Relative Policy Optimization

  5. Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

    Sep 30, 2026Tong Zheng, Skylar Zhai, Zhan Cheng +7Multi-Objective Reinforcement LearningReinforcement Learning

  6. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  7. Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR

    Sep 30, 2026Chandak Chakma, Syed Nazmus Sakib, Nafiul Haque +1Reinforcement LearningRL for Language Model Reasoning

  8. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1RL for Language Model ReasoningCredit Assignment in RL

  9. Learning Process Rewards via Reasoning State Propagation

    Sep 30, 2026Kai Gan, Zi-Hao Zhou, Bo Ye +3Process Reward ModelsRL for Language Model Reasoning

  10. T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning

    Sep 30, 2026Liuxian Ma, Jiale Dai, Jiaqi Li +1Reinforcement LearningRL for Language Model Reasoning

  11. Mitigating the Length-Scaling Tax with Online Distillation

    Sep 30, 2026Xu Wan, Wenyue Xu, Shengjie Zhao +1RL for Language Model ReasoningOn-Policy Distillation

  12. StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning

    Sep 30, 2026Naen Xu, Wanqing Cui, Yibo Hu +5Temporal Reasoning in Language ModelsRL for Language Model Reasoning

  13. GraphCert: Bootstrap Agentic Graph Reasoning with Certified Evidence Rubrics

    Sep 30, 2026Weiqi Jiang, Yuchen Ying, Rui Wang +5LLM Reasoning with GraphsRL for Language Model Reasoning

  14. What Pretraining and Midtraining Make Learnable from Rewards?

    Sep 29, 2026Chiwun Yang, Xiaoyu LiRL for Language Model ReasoningContinued Pretraining

  15. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1LLM EvaluationRL for Language Model Reasoning

  16. Diagnosing and Improving Probabilistic Reasoning in Large Language Models

    Sep 29, 2026Huaman Sun, Dingcheng Wang, Jason Hartline +1RL for Language Model ReasoningLLM Decision-Making

  17. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  18. MetaCtrl: Your Large Language Models Can Reason Better and More Concisely with a Metacognitive Controller

    Sep 29, 2026Zhibin Wen, Tao Han, Lei Bai +2RL for Language Model ReasoningEfficient Language Model Reasoning

  19. Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning

    Sep 29, 2026Qili Zhang, Qianren Mao, Hanze Cai +11Logical ReasoningRL for Language Model Reasoning

  20. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation

  21. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  22. SRJudge: Empowering Large Language Models with Selective Reasoning for Fine-Grained Knowledge Concept Tagging

    Sep 29, 2026Zhiwei Yang, Jiahua Yang, Huiru Lin +2RL for Language Model ReasoningAI in Education

  23. Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training

    Sep 29, 2026Chenliang Li, Neiwen Ling, Zijun Wei +1Asynchronous RLRL for Language Model Reasoning

  24. CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

    Sep 29, 2026Wenbin Hu, Huihao Jing, Haochen Shi +3Multi-Objective Reinforcement LearningRL for Language Models

  25. SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation

    Sep 29, 2026Zhenrui Yue, Huimin Zeng, Yueqi Wang +8RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards