RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

    Aug 11, 2026Chenhao Dang, Siyuan Xiong, Conghui He +1RL for Language ModelsSmall Language Models

  2. Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

    Aug 10, 2026Alec Harris, Kasey Corra, Archie Chaudhury +1RL for Language ModelsLLM Alignment

  3. REATS: LLM Reasoning-based Ensemble Learning for Adaptive Time Series Forecasting

    Aug 10, 2026Xu Zhang, Chang Xu, Hui Sun +5RL for Language ModelsExplainable Time Series Forecasting

  4. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  5. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

    Aug 10, 2026Jinkun Hou, Zhuo Liu, Huimin Ren +3Open-Ended GenerationRL for Language Models

  6. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Reward ModelingRL for Language Models

  7. Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

    Aug 5, 2026Zheyuan Zhang, Manqing Mao, Hong Wang +8RL for Language ModelsRL Post-Training

  8. Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

    Aug 5, 2026Xuzheng Yang, Jun Ling, Tao Huang +2RL for Language ModelsGroup Relative Policy Optimization

  9. Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

    Aug 4, 2026Meicong Zhang, Tiancheng Su, Jiahao Cheng +3RL for Language ModelsAI-Assisted Scientific Research

  10. Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

    Aug 4, 2026Xiang Lin, Tian-Hao Zhang, Chunfeng Wang +3RL for Language ModelsSpoken Dialogue Systems

  11. HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

    Aug 3, 2026Haowei Liu, Jiamian Wang, Hsin-Tai Wu +2RL for Language ModelsAgentic Search

  12. Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

    Jul 31, 2026Ruiming Liang, Yi Zhong, Yizhen Yuan +6Multi-Objective Reinforcement LearningRL for Language Models

  13. HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

    Jul 30, 2026Tiangang Li, Xiangbo TianRL for Language ModelsLLM Alignment

  14. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Jul 27, 2026Md Rezwanul Haque, Md. Milon Islam, Fakhri KarrayRL for Language ModelsLLM Alignment

  15. Inverse RL Helps Align AI by Imitating Humans

    Jul 27, 2026Michał Wiliński, Liu Leqi, Chirag NagpalRL for Language ModelsLLM Alignment

  16. LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

    Jul 26, 2026Xiao You, Tianwei Yan, Zixu Shan +2LLM Self-CorrectionRL for Language Models

  17. Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

    Jul 24, 2026Zixuan Ren, Jinliang Lu, Junhong Wu +5RL for Language ModelsLanguage Model Merging

  18. EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

    Jul 23, 2026Lihuang Fang, Yuchen Zou, kebing Jin +1RL for Language ModelsAgentic RL

  19. Co-Evolving LLM Evaluators and Policies via DynamicRubric

    Jul 22, 2026Beining Wang, Weihang Su, Hongtao Tian +8RL for Language ModelsLLM Evaluation

  20. The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

    Jul 21, 2026Michael Jungo, Aixiu AnRL for Language ModelsRL for Language Model Reasoning

  21. Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

    Jul 21, 2026Aixiu An, Michael Jungo, Eloi Eynard +4RL for Language ModelsLegal NLP

  22. REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

    Jul 21, 2026Yunjie Chen, Xiaoxin Chen, Fang WangRL for Language ModelsRL for Language Model Reasoning

  23. Measuring Reward-Seeking via Contrastive Belief Updates

    Jul 21, 2026Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya +5RL for Language ModelsLLM Alignment

  24. OR Else: A Differentiable Trust Region for Policy Optimization

    Jul 20, 2026Chinmay Rane, Kanishka Tyagi, Michael ManryRL for Language ModelsGroup Relative Policy Optimization

  25. Group Entropy-Controlled Policy Optimization

    Jul 18, 2026Guangran Cheng, Chengqi Lyu, Songyang Gao +2RL for Language ModelsGroup Relative Policy Optimization