Large Language Model Reinforcement Learning

Latest papers 194

All topics
CardsList
  1. On Language Drift during RLVR Post-Training

    Oct 1, 2026Michael Sullivan, Alexander KollerLarge Language Model Reinforcement LearningLLM Reasoning Strategies

  2. Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

    Oct 1, 2026Yu Mao, Lei Yu, Zining Zhu +6Large Language Model Reinforcement LearningLLM Reasoning Strategies

  3. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2Diffusion Language ModelsLarge Language Model Reinforcement Learning

  4. GrammarRL: Effective Grammar-Constrained Decoding via Reinforcement Learning

    Sep 30, 2026Gabriele Tuccio, Antonino Furnari, Aldo Gangemi +1Language ModelingConstrained Decoding

  5. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1Critic-Free Reinforcement LearningLarge Language Model Reinforcement Learning

  6. Jailbreaks for Black-Box Uncertainty Quantification in Large Reasoning Models

    Sep 28, 2026Lucas Biechy, Cédric Eichler, Adrien Boiret +1Large Language Model UncertaintyLarge Reasoning Models

  7. LLMs as Adaptive Meta-Solvers: Strategy-Diverse RL for Industrial-Scale Optimization

    Sep 28, 2026Shihao Zhang, Weiting Liu, Siyu Shao +4Optimization ModelingLarge Language Model Reinforcement Learning

  8. QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    Sep 27, 2026Weiqi Wang, Yuxin Zhou, Mouxiang Chen +9Large Language Model Reinforcement LearningOffline Reinforcement Learning

  9. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4Large Language Model Reinforcement LearningGroup-Based Reinforcement Learning

  10. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

    Sep 23, 2026Yingxuan Zhuang, Miao Pan, Wangjie Gan +6Large Language Model Reinforcement LearningLarge Language Model Hallucination

  11. DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

    Sep 23, 2026Henan Sun, Zehua Li, Haitao Hu +4Large Language Model Reinforcement LearningOffline Reinforcement Learning

  12. Informed Masking: Structure-Aware Perturbation for Reinforcement Learning in Diffusion Large Language Models

    Sep 22, 2026Xiaoyi Yu, Enver Sangineto, Pei Fu +6Diffusion Language ModelsLarge Language Model Reinforcement Learning

  13. Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions

    Sep 21, 2026Niloofar Gholipour, Marcos Assuncao, Gursimran Singh +8Large Language Model Reinforcement LearningRollout

  14. Learning to Coach for Experiential Learning

    Sep 14, 2026Guanheng Chen, Tianzhu Ye, Li Dong +3Coaching SystemsAgentic Learning

  15. What Does an LLM Learn from Reinforcement Learning? A Mechanistic Interpretability Perspective with Fixed-SAE Track

    Sep 14, 2026Lingheng Du, Yiming Tang, Xufeng Duan +1Large Language Model Reinforcement LearningImproving Sparse Autoencoders

  16. Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training

    Sep 14, 2026Yuanhao Yue, Qianli Ma, Chengyu Wang +3Large Language Model Reinforcement LearningOffline Reinforcement Learning

  17. Expert-Space Exploration in MoE Reinforcement Learning

    Sep 14, 2026Hongyi He, Zhenghao Lin, Xiao Liu +3Mixture-Of-ExpertsLarge Language Model Reinforcement Learning

  18. Negative Self-Distillation: Learning to Reason by Avoiding Flaws

    Sep 10, 2026Rongcan Pei, Zhepei Wei, Shuyao Xu +3Unsupervised On-Policy Self-DistillationSelf-Distillation Framework

  19. CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

    Sep 1, 2026Chaohui Guo, Michel Klein, Zhisheng HuangLarge Language Model Reinforcement Learning

  20. CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training

    Sep 1, 2026Siyuan Li, Xinxin Song, Chen Ruinian +5Large Language Model Reinforcement LearningLarge Language Model Evaluation

  21. Controlling Refusal Behavior of LLMs via Stiefel-Constrained Rotation Steering

    Aug 31, 2026Kirill Bunin, Dmitry Bylinkin, Vladimir Aletov +3Linear Activation SteeringSteering

  22. Parameter Exploration for RLVR via Variational Learning

    Aug 10, 2026Vatsal Venkatkrishna, Nico Daheim, Iryna GurevychLarge Language Model Reinforcement LearningReinforcement Learning With Verifiable Reward

  23. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

    Aug 10, 2026Jinkun Hou, Zhuo Liu, Huimin Ren +3Large Language Model Reinforcement LearningIcr-Rl

  24. Progressive Content Refinement with Decaying Reward Joint LinUCB

    Aug 7, 2026Shion Ishikawa, Pablo Loyola, Young-joo Chung +1Contextual Bandit FrameworkLarge Language Model Reinforcement Learning

  25. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Large Language Model Reinforcement Learning

  26. SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

    Aug 5, 2026Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo +2Autoregressive RolloutLarge Language Model Reinforcement Learning

  27. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

    Aug 4, 2026Jinhe Bi, Chennan Zhou, Zengjie Jin +10Reasoning TrajectoryLarge Language Model Reinforcement Learning

  28. CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

    Aug 4, 2026Ziqi Jia, Yalu Ouyang, Bo Pang +5Large Language Model Reinforcement LearningFrictive Policy Optimization

  29. Start Classifying: Categorical Critics for LLM Reinforcement Learning

    Aug 3, 2026Zhijian Zhou, Long Li, Xuan Zhang +7Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  30. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1Large Language Model Reinforcement LearningAutoregressive Rollout

  31. Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

    Aug 2, 2026Wenhao Zhang, Yibo Xie, Rui Wang +9Autoregressive RolloutLarge Language Model Reinforcement Learning

  32. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Jul 27, 2026Md Rezwanul Haque, Md. Milon Islam, Fakhri KarrayLarge Language Model Reinforcement LearningSmall Large Language Models

  33. Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

    Jul 24, 2026Zixuan Ren, Jinliang Lu, Junhong Wu +5Large Language Model Reinforcement LearningSubspace

  34. Training Large Language Models for Self-Explanation Faithfulness

    Jul 23, 2026Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel +1LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  35. Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

    Jul 21, 2026Wentao Zhang, Haoyu Zhang, Xinke Jiang +7LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  36. MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

    Jul 20, 2026Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov +3Large Language Model Reinforcement LearningIcr-Rl

  37. Trace-Based On-Policy Distillation for Masked Diffusion Language Models

    Jul 18, 2026Haolin Ren, Ziyang Huang, Chenhao Yuan +2Diffusion Language ModelsMasked Diffusion Language Models

  38. Mask-Aware Policy Gradients for Diffusion Language Models

    Jul 16, 2026Haran Raajesh, Kulin Shah, Adam Klivans +1Masked Diffusion Language ModelsLarge Language Model Reinforcement Learning

  39. Predictive Divergence Masks for LLM RL

    Jul 12, 2026Xiangxin Zhou, Jiarui Yao, Penghui Qi +4Large Language Model Reinforcement LearningDivergence

  40. ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

    Jul 11, 2026Kexin Huang, Junkang Wu, Jinda Lu +7Large Language Model Reinforcement LearningReasoning Benchmark

  41. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

    Jul 11, 2026Zhicheng Cai, Xinyuan Guo, Hanlin Wu +4Large Language Model Reinforcement LearningGradient Clipping

  42. Multimodal Reward Hacking in Reinforcement Learning

    Jul 10, 2026Jiayu Yao, Yiwei Wang, Anmeng Zhang +5Large Language Model Reinforcement Learning

  43. Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

    Jul 10, 2026Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi +1Contextual Bandit FrameworkLarge Language Model Routing

  44. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6Large Language Model Reinforcement LearningRollout

  45. When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

    Jul 8, 2026Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang +4Large Language Model Reinforcement Learning

  46. Large Behavior Model: A Promptable Digital Twin of the Retail Customer

    Jul 8, 2026Wachiravit Modecrua, Krittin Pachtrachai, Touchapon KraisingkornBehavioral Foundation ModelsLarge Language Model Reinforcement Learning

  47. Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

    Jul 7, 2026Alexander Rombach, Chantale Lauer, Nijat MehdiyevProcess Reward ModelLarge Language Model Reinforcement Learning

  48. CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

    Jul 6, 2026Qiuyi Qi, Jinjian Zhang, Mutian Bao +9Large Language Model PlanningLarge Language Model Reinforcement Learning