Large Language Model Reinforcement Learning

Latest papers 194

All topics
CardsList
  1. Reinforcement Learning from Denoising Feedback

    May 25, 2026Qi He, Huan Chen, Ya Guo +3Large Language Model Reinforcement LearningDiffusion-Based Reinforcement Learning Methods

  2. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5Large Language Model Reinforcement LearningQuestion-Answer Pairs

  3. Reinforced Graph of Thoughts: RL-Driven Adaptive Prompting for LLMs

    May 21, 2026Manuel Noah Riesen, Peter Alfred von NiederhäusernLarge Language Model Reinforcement LearningLLM Reasoning Strategies

  4. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  5. Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

    May 20, 2026Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand +2Code GenerationLlm-Driven Code Synthesis

  6. Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

    May 20, 2026Jungsoo Park, Hyungjoo Chae, Ethan Mendes +4Large Language Model Reinforcement LearningMoleculenet

  7. General Preference Reinforcement Learning

    May 18, 2026Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal +5Large Language Model Reinforcement LearningPreference Alignment Learning

  8. Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

    May 14, 2026Zeli Su, Ziyin Zhang, Zhou Liu +7Large Language Model Reinforcement LearningLarge Language Model Alignment

  9. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2Large Language Model Reinforcement LearningAdaptive Sampling

  10. PriorZero: Bridging Language Priors and World Models for Decision Making

    May 12, 2026Junyu Xiong, Yuan Pu, Jia Tang +1Large Language Model Reinforcement LearningWorld Model Planning

  11. ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

    May 11, 2026Wanghan Xu, Yuhao Zhou, Hengyuan Zhao +8CriticLarge Language Model Reinforcement Learning

  12. Relative Score Policy Optimization for Diffusion Language Models

    May 11, 2026Zichao Yu, Shengze Xu, Bingqing Jiang +2Large Language Model Reinforcement LearningDiffusion Language Models

  13. LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

    May 10, 2026Songtao Wei, Yi Li, Zhikai Li +7Large Reasoning ModelsLarge Language Model Reinforcement Learning

  14. ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning

    May 9, 2026Chao Jin, Xinming Wei, Yinmin Zhong +6Load BalancingLarge Language Model Reinforcement Learning

  15. Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

    May 8, 2026Aswin RRV, Jacob Dineen, Divij Handa +4Large Language Model Reinforcement LearningLLM Reasoning Strategies

  16. ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

    May 8, 2026Tingcheng Bian, Yuzhe Zhang, Jing Jin +5Large Reasoning ModelsChain-of-Thought Reasoning

  17. Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

    May 8, 2026Wanli Yang, Hongyu Zang, Junwei Zhang +5LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  18. A Systematic Investigation of RL-Jailbreaking in LLMs

    May 7, 2026Montaser Mohammedalamen, Kevin Roice, Reginald McLean +1Jailbreak AttacksLarge Language Model Reinforcement Learning

  19. Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

    May 7, 2026Tianle Wang, Zhaoyang Wang, Guangchen Lan +4LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  20. DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

    May 5, 2026Hongbo Jin, Rongpeng Zhu, Zhongjing Du +4Large Language Model Reinforcement LearningCredit Assignment

  21. Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

    May 3, 2026Arash Ahmadi, Sarah Sharif, Yaser +1Large Language Model Reinforcement LearningLLM Reasoning Strategies

  22. Segment-Aligned Policy Optimization for Multi-Modal Reasoning

    May 2, 2026Lei Gao, Zhuoming Li, Mengxi Jia +4Large Language Model Reinforcement LearningMultimodal Reasoning

  23. Exploration Hacking: Can LLMs Learn to Resist RL Training?

    Apr 30, 2026Eyon Jang, Damon Falck, Joschka Braun +6Large Language Model Reinforcement LearningOffline Reinforcement Learning

  24. Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning

    Apr 30, 2026Shijin Gong, Kai Ye, Jin Zhu +3Large Language Model Reinforcement LearningLLM Reasoning Strategies

  25. Relation Reasoning with LLMs in Expensive Optimization

    Apr 30, 2026Ye Lu, Bingdong Li, Aimin Zhou +1Optimization ModelingLarge Language Model Reinforcement Learning

  26. A Reproducibility Analysis of PO4ISR: Diagnosing and Mitigating Semantic Drift in LLM-Based Session Recommendation

    Apr 29, 2026Aditya Tiwari, Konduri Naga Lakshmi Rekha, Rajesh Kumar MundotiyaLLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  27. Bridging Reasoning and Action: Hybrid LLM-RL Framework for Efficient Cross-Domain Task-Oriented Dialogue

    Apr 25, 2026Yangyang Zhao, Linfan Dai, Li Cai +2Large Language Model Reinforcement LearningLLM Reasoning Strategies

  28. Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

    Apr 20, 2026Zhenwen Liang, Yujun Zhou, Sidi Lu +3Large Language Model Reinforcement LearningStochastic Exploration

  29. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1Credit AssignmentLarge Language Model Reinforcement Learning

  30. LEPO: Latent Reasoning Policy Optimization for Large Language Models

    Apr 20, 2026Yuyan Zhou, Jiarui Yu, Hande Dong +4Efficient Latent ReasoningLarge Language Model Reinforcement Learning

  31. Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

    Apr 19, 2026Zhiyin Yu, Bo Zhang, Qibin Hou +3Large Language Model Reinforcement LearningLarge Language Model Training

  32. A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

    Apr 19, 2026Zhiyin Yu, Yuchen Mou, Juncheng Yan +17Large Language Model Reinforcement LearningLarge Language Model Training

  33. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

    Apr 18, 2026Yifu Huo, Chenglong Wang, Ziming Zhu +9LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  34. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Large Language Model Reinforcement LearningPrioritized Experience Replay

  35. Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

    Apr 17, 2026Moein Salimi, Babak Hosseini Mohtasham, Amin Aghakasiri +6Scientific IdeationLarge Language Model Reinforcement Learning

  36. LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

    Apr 16, 2026Bowen Ping, Zijun Chen, Tingfeng Hui +4Efficient Long-Context InferenceLarge Language Model Reinforcement Learning

  37. Targeted Exploration via Unified Entropy Control for Reinforcement Learning

    Apr 16, 2026Chen Wang, Lai Wei, Yanzhi Zhang +5Large Language Model Reinforcement LearningReasoning Trajectory

  38. TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training

    Apr 10, 2026Chenhao Ye, Huaizheng Zhang, Mingcong Han +11Large Language Model Reinforcement LearningOffline Reinforcement Learning

  39. RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

    Apr 1, 2026Shaopeng Fu, Xingxing Zhang, Li Dong +1Large Language Model Reinforcement LearningLLM Reasoning Strategies

  40. rePIRL: Learn PRM with Inverse RL for LLM Reasoning

    Feb 8, 2026Xian Wu, Kaijie Zhu, Ying Zhang +2Process Reward ModelLarge Language Model Reinforcement Learning

  41. The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

    Feb 6, 2026Yingru Li, Jiawei Xu, Ziniu Li +10Large Language Model Reinforcement LearningVariance Reduction

  42. Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

    Feb 4, 2026Jaemoo Choi, Yuchen Zhu, Wei Guo +6Diffusion-Based Reinforcement Learning MethodsReward Gradients

  43. VLM-Guided Experience Replay

    Feb 2, 2026Elad Sharony, Tom Jurgenson, Orr Krupnik +2Large Language Model Reinforcement LearningPrioritized Experience Replay

  44. HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

    Jan 30, 2026Weiqi Wang, Xin Liu, Binxuan Huang +13Large Language Model Reinforcement LearningPrompt Engineering

  45. Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

    Jan 26, 2026Shobhita Sundaram, John Quan, Ariel Kwiatkowski +3Curriculum Reinforcement LearningSelf-Play