Large Language Model Reinforcement Learning

Latest papers 194

All topics
CardsList
  1. Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning

    Jul 5, 2026Faid Keddouri, Sohaib Houhou, Aissa Boulmerka +1Potential-Based Reward ShapingMulti-Agent Reinforcement Learning

  2. On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

    Jul 5, 2026Chee Heng Tan, Zhuoyi Lin, Mehul Motani +1Large Language Model Reinforcement LearningLarge Language Model Reliability

  3. Aligning Language Models with Selective Prediction

    Jul 3, 2026Gaoxiang Luo, Yifan Wu, Sinian Zhang +2Large Language Model AlignmentLarge Language Model Reliability

  4. Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    Jul 2, 2026Xuqing Yang, Yi Yuan, Shanzhe Lei +1Confidence EstimationLarge Language Model Reliability

  5. SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

    Jun 30, 2026Ruikang Zhao, Zhenting Wang, Han Gao +1Diffusion Language ModelsLarge Language Model Reinforcement Learning

  6. Addressing Over-Refusal in LLMs with Competing Rewards

    Jun 30, 2026Taeyoun Kim, Aviral KumarLarge Language Model SafetyLLM Reasoning Strategies

  7. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

    Jun 29, 2026Haisen Luo, Yiwei Liu, Haoning Wang +13Unsupervised On-Policy Self-DistillationLarge Language Model Reinforcement Learning

  8. ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

    Jun 29, 2026Zilong Liu, Xuewen Zhang, Jinrui Xing +3Probe-Logit DistillationKullback-Leibler Divergence

  9. RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

    Jun 25, 2026Rongjian Chen, Jianmin Hu, Kejiang Ye +1Large Language Model Reinforcement LearningRollout

  10. GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

    Jun 25, 2026Ting Zhou, Zhenqing Ling, Yiyang Zhao +2Large Language Model AlignmentLarge Language Model Reinforcement Learning

  11. Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

    Jun 24, 2026Yupu Hao, Zhuoran Jin, Huanxuan Liao +2Large Language Model Reinforcement LearningAgentic Reinforcement Learning

  12. OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

    Jun 24, 2026Wenxuan Jiang, Zining Fan, Zijian Zhang +6LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  13. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4Large Language Model Reinforcement LearningCredit Assignment

  14. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

    Jun 22, 2026Hongxin Ding, Baixiang Huang, Yue Fang +6On-Policy Self-EvolutionLarge Language Model Reinforcement Learning

  15. Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

    Jun 21, 2026Pengxiang Cai, Tianchen Fang, Xiaohan Li +3Curriculum Reinforcement LearningLarge Language Model Reinforcement Learning

  16. Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

    Jun 21, 2026Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang +7Large Language Model Reinforcement LearningLarge Language Model Training

  17. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18Large Language Model Reinforcement LearningOffline Reinforcement Learning

  18. Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

    Jun 19, 2026Zibin Meng, Peng Xie, Kani ChenLLM Reasoning StrategiesRecursive Reasoner

  19. From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

    Jun 16, 2026Lingjing Kong, Xin Liu, Guangyi Chen +9LLM Reasoning StrategiesCompositional Generalization

  20. From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

    Jun 16, 2026Chao Chen, Chengzu Li, Zhiwei Li +2Large Language Model Reinforcement Learning

  21. The Value Axis: Language Models Encode Whether They're on the Right Track

    Jun 15, 2026Nick Jiang, Isaac Kauvar, Jack LindseyLarge Language Model Reinforcement LearningValue

  22. ExpRL: Exploratory RL for LLM Mid-Training

    Jun 15, 2026Violet Xiang, Amrith Setlur, Chase Blagden +2Large Language Model Reinforcement LearningLLM Reasoning Strategies

  23. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

    Jun 14, 2026Zebang Cheng, Shuimu Chen, Boxue Yang +7Unsupervised On-Policy Self-DistillationLarge Language Model Reinforcement Learning

  24. Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

    Jun 13, 2026Zirui Pang, Chenlong Zhang, Haosheng Tan +3Large Language Model UnlearningLarge Language Model Reinforcement Learning

  25. ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

    Jun 11, 2026Xucong Wang, Ziyu Ma, Yong Wang +5Large Language Model Reinforcement LearningLLM Reasoning Strategies

  26. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Large Language Model RoutingLarge Language Model Reinforcement Learning

  27. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5Mathematical Reasoning BenchmarksLarge Language Model Reinforcement Learning

  28. How Does Reasoning Flow? Tracing Attention-Induced Information Flow for Targeted RL in LLMs

    Jun 9, 2026Zhichen Dong, Yang Li, Yuhan Sun +9Large Language Model Reinforcement LearningLLM Reasoning Strategies

  29. Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

    Jun 9, 2026Jiangnan Xia, Yucheng Shi, Yu Yang +3Large Language Model Reinforcement LearningMemorization

  30. Rethinking the Divergence Regularization in LLM RL

    Jun 8, 2026Jiarui Yao, Xiangxin Zhou, Penghui Qi +3Large Language Model Reinforcement LearningTrust Region

  31. Gradient-Guided Reward Optimization for Inference-time Alignment

    Jun 8, 2026Hankun Lin, Ruqi ZhangLarge Language Model AlignmentReward Gradients

  32. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Large Language Model Reinforcement LearningOffline Reinforcement Learning

  33. Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

    Jun 7, 2026Jiashun Liu, Runze Liu, Xu Wan +3Large Language Model Reinforcement LearningTraining-Inference Mismatch

  34. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6Large Language Model Reinforcement LearningDiffusion Language Models

  35. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

    Jun 7, 2026Yanyan Wu, Boyi Zhang, Yanlin Liu +10Large Language Model Reinforcement LearningOffline Reinforcement Learning

  36. Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

    Jun 7, 2026Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun +7Autoregressive RolloutLarge Language Model Reinforcement Learning

  37. Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation

    Jun 6, 2026Boxuan Lyu, Haiyue Song, Zhi Qu +3Machine Translation QualityMachine Translation

  38. SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

    Jun 5, 2026Yuchen He, Baolong Bi, Shenghua Liu +7Multi-Objective Reinforcement LearningLarge Language Model Reinforcement Learning

  39. Efficient Hyperparameter Optimization for LLM Reinforcement Learning

    Jun 2, 2026Minping Chen, Bowen Xiao, Du Liang +2Large Language Model Reinforcement LearningGeneral Grid Search Framework

  40. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

    May 29, 2026Daize Dong, Junlin Chen, Haolong Jia +9Large Language Model Reinforcement LearningReplay

  41. Consolidating Rewarded Perturbations for LLM Post-Training

    May 29, 2026Zheyu Zhang, Shuo Yang, Gjergji KasneciLarge Language Model Reinforcement LearningPost-Training

  42. DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

    May 29, 2026Yujie Wang, Siwei Chen, Longzan Luo +4Large Language Model Reinforcement LearningAutoregressive Rollout

  43. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Safety AlignmentLarge Language Model Alignment

  44. ESPO: Early-Stopping Proximal Policy Optimization

    May 28, 2026Zihang Li, Rui Zhou, Yingcheng Shi +8Large Language Model Reinforcement LearningProximal Policy Optimization

  45. Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

    May 28, 2026Zizhe Chen, Jiqian Dong, Yizhou Tian +4Large Language Model Reinforcement LearningState Estimation

  46. The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF

    May 28, 2026Zeli Su, Zhankai Xu, Tianlei Chen +4Large Language Model Reinforcement LearningInstruction-Tuned Models

  47. DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

    May 27, 2026Caijun Xu, Changyi Xiao, Zhongyuan Peng +1Large Language Model Reinforcement LearningLarge Reasoning Models