RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Reinforcement LearningProcess Reward Models

  2. SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

    Sep 29, 2026Zihao Chen, Fanxiang Xiong, Hongran Ren +6Reinforcement LearningRL for Language Model Reasoning

  3. An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

    Sep 28, 2026Shangzhe Li, Yuxiao Yang, Tianrun Yu +4RL for Language Model ReasoningLanguage Model Distillation

  4. Frontier Learning: Training LLM Reasoners at the Edge of Capability

    Sep 28, 2026Robin Faro, Shyam Sundhar Ramesh, Ilija Bogunovic +1RL for Language Model ReasoningLLM Post-Training

  5. MaPP: A Unified Marginalized Posterior-Predictive Framework for Data-Efficient RLVR

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Sheng Xu +4Bayesian RLRL for Language Model Reasoning

  6. Teach to Learn: Hint Annealing for Self-improving LLM Reasoning

    Sep 28, 2026Zile Wang, Zijian Li, Haodong Wang +5Reinforcement LearningSelf-Training for Language Models

  7. Beyond Verbalized Confidence: Calibrating Reasoners with Differentiable Readouts

    Sep 28, 2026Chenxiao Fan, Chongming Gao, Gangyi Zhang +8Confidence Estimation in Language ModelsRL for Language Model Reasoning

  8. Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation

    Sep 28, 2026Yugu Li, Zehong Cao, Peizhen Li +3Token-Level Credit AssignmentRL for Language Model Reasoning

  9. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1RL for Language Model ReasoningProcess Supervision

  10. GlyphBench: A Playground for Language-Model Reinforcement Learning

    Sep 28, 2026Roger Creus Castanyer, Marc-Alexandre Côté, Matthew James Sargent +3RL BenchmarksRL for Language Models

  11. On the Token Value Inequality in Efficient Reasoning

    Sep 27, 2026Runjia Zeng, Hang Hua, Yiyang Liu +5RL for Language Model ReasoningEfficient Language Model Reasoning

  12. Selecting Diverse SFT Traces Improves Post-RL Generalization

    Sep 27, 2026Dylan Zhang, Mingyuan Wu, Jinning LiReasoning DiversityRL for Language Model Reasoning

  13. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4RL for Language ModelsRL for Language Model Reasoning

  14. OpenFC: Learning Verification Policies towards Open-Search Fact Checking

    Sep 27, 2026Xinming Wang, Kaixiang Qiu, Yansong Lin +5RL for Language Model ReasoningAutomated Fact-Checking

  15. TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment

    Sep 27, 2026Zhenyu Lei, Zihan Chen, Yaochen Zhu +5Reasoning DistillationRL for Language Model Reasoning

  16. Rufus-Air: An Open LLM Post-Training Recipe

    Sep 24, 2026Chia-Yuan Chang, Renyuan Cheng, Rui Feng +19LLM Fine-TuningRL for Language Model Reasoning

  17. RL Starts before RL: On Policy Distillation for Better Reinforcement Learning

    Sep 23, 2026Shuai Dong, Yongfu Zhu, Yuqi Xu +26Reinforcement LearningRL for Language Model Reasoning

  18. DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

    Sep 23, 2026Henan Sun, Zehua Li, Haitao Hu +4Reinforcement LearningRL for Language Model Reasoning

  19. Planned Test-Time Scaling with Coordinated Reasoning Paths

    Sep 23, 2026Xueqing Wu, Langxing Bai, Hritik Bansal +5RL for Language Model ReasoningTest-Time Scaling

  20. Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

    Sep 22, 2026Ismail Labiad, Matthieu Kowalski, Marc Schoenauer +2RL for Language Model ReasoningLLM Reasoning

  21. Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions

    Sep 21, 2026Niloofar Gholipour, Marcos Assuncao, Gursimran Singh +8LLM Inference EfficiencyReinforcement Learning

  22. TelecomGPT-R1: Unified Post-Training for Reasoning Across Heterogeneous Telecom Tasks

    Sep 21, 2026Bohao Wang, Chenwei Wu, Hang Zou +7LLM GroundingRL for Language Model Reasoning