Large Language Model Reinforcement Learning

Latest papers 194

All topics
CardsList
  1. Trust Region Masking for Long-Horizon LLM Reinforcement Learning

    Dec 28, 2025Yingru Li, Jiacai Liu, Jiawei Xu +4Large Language Model Reinforcement LearningTrust Region

  2. OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

    Oct 28, 2025Ziyou Hu, Zhengliang Shi, Minghang Zhu +5Progress Reward ModelingLarge Language Model Reinforcement Learning

  3. Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

    Oct 10, 2025Xinyi Wang, Jinyi Han, Zishang Jiang +7LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  4. ReST-RL: Reinforcing LLM Reasoning through Unified Self-Training and Value-Guided Search

    Aug 27, 2025Sining Zhoubian, Dan Zhang, Jie TangLLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  5. The Bidirectional Process Reward Model

    Aug 3, 2025Lingyin Zhang, Jun Gao, Xiaoxue Ren +1Process Reward ModelLLM Reasoning Strategies

  6. Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

    Jul 29, 2025Carel van Niekerk, Renato Vukovic, Benjamin Ruppik +3Large Language Model Reinforcement LearningLLM Reasoning Strategies

  7. A Technical Survey of Reinforcement Learning Techniques for Large Language Models

    Jul 5, 2025Saksham Sahai Srivastava, Vaneet AggarwalLarge Language Model Reinforcement LearningOffline Reinforcement Learning

  8. Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents

    Feb 6, 2025Selim Furkan Tekin, Gaowen Liu, Ramana Rao Kompella +1Large Language Model Reinforcement LearningEnsemble

  9. RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner

    Oct 31, 2024Fu-Chieh Chang, Yu-Ting Lee, Hui-Ying Shih +2Large Language Model Reinforcement LearningLLM Reasoning Strategies

  10. Unleash LLMs Potential for Sequential Recommendation by Coordinating Dual Dynamic Index Mechanism

    Sep 14, 2024Jun Yin, Zhengxin Zeng, Mingzheng Li +11Multimodal Recommendation ModelSequential Recommendation

  11. Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

    Date pendingZikang Shan, Han Zhong, Liwei Wang +1Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  12. A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

    Date pendingMiguel Moura Ramos, Duarte M. Alves, André F. T. MartinsEfficient Long-Context InferenceLong-Context Reasoning