RL for Language Model Reasoning

RL: Reinforcement Learning

Latest papers 707

All topics
CardsList
  1. ReST-RL: Reinforcing LLM Reasoning through Unified Self-Training and Value-Guided Search

    Aug 27, 2025Sining Zhoubian, Dan Zhang, Jie TangRL for Code GenerationRL for Language Model Reasoning

  2. Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

    Aug 13, 2025Maxime Heuillet, Yufei Cui, Boxing Chen +2RL for Language Model ReasoningEfficient Language Model Training

  3. From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control

    Aug 6, 2025Rui Ha, Rui Pu, Chaozhuo Li +2RL for Language Model ReasoningLLM Inference Acceleration

  4. Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning

    Aug 4, 2025Taihang Zhen, Jialiang Hong, Kai Chen +12RL for Language Model ReasoningCoT Compression

  5. Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications

    Aug 1, 2025Zizhan Ma, Wenxuan Wang, Meidan Ding +7LLM PromptingRL for Language Model Reasoning

  6. Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

    Jul 29, 2025Carel van Niekerk, Renato Vukovic, Benjamin Ruppik +3RL for Language ModelsRL for Language Model Reasoning

  7. Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

    Jul 22, 2025Chuanhao Yan, Fengdi Che, Xuhan Huang +12RL for Language ModelsRL for Language Model Reasoning

  8. Evaluating the Scalability and Adversarial Generalization of GRPO-Trained NLI Models

    Apr 25, 2025Pablo Miralles-González, Javier Huertas-Tato, Alejandro Martín +1LLM Fine-TuningRL for Language Model Reasoning

  9. Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

    Apr 7, 2025Taiwei Shi, Yiyang Wu, Linxin Song +2RL for Language Model ReasoningMathematical Reasoning

  10. LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

    Apr 3, 2025Weibin Liao, Xin Gao, Tianyu Jia +6LLM PlanningRL for Language Model Reasoning

  11. RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner

    Oct 31, 2024Fu-Chieh Chang, Yu-Ting Lee, Hui-Ying Shih +2Reinforcement LearningRL for Language Model Reasoning

  12. Amortizing intractable inference in large language models

    Oct 6, 2023Edward J. Hu, Moksh Jain, Eric Elmoznino +4Amortized InferenceLLM Fine-Tuning

  13. Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

    Date pendingMuhammad Khalifa, Zohaib Khan, Omer Tafveez +2RL BenchmarksReward Hacking

  14. A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

    Date pendingMiguel Moura Ramos, Duarte M. Alves, André F. T. MartinsLLM AlignmentRL for Language Model Reasoning

  15. Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

    Date pendingAnthony GX-Chen, Ankit Anand, Gheorghe Comanici +7Reinforcement LearningRL for Language Model Reasoning