RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

    Apr 17, 2026Moein Salimi, Babak Hosseini Mohtasham, Amin Aghakasiri +6Reward HackingRL for Language Models

  2. Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO

    Apr 17, 2026Arash Ahmadi, Parisa Masnadi, Sarah Sharif +3RL for Language ModelsHealthcare

  3. Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

    Apr 14, 2026Leon Eshuijs, Shihan Wang, Antske FokkensReward HackingRL for Language Models

  4. TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training

    Apr 10, 2026Chenhao Ye, Huaizheng Zhang, Mingcong Han +11RL for Language ModelsCommunication-Efficient Distributed Training

  5. Less Data Approximates More: Earning Faithful Confidence in High-Stakes Domains

    Apr 9, 2026Haokai Ma, Lee Yan Zhen, Gang Yang +4RL for Language ModelsReinforcement Learning

  6. Policy Improvement Reinforcement Learning

    Apr 1, 2026Huaiyang Wang, Xiaojie Li, Xiaohan Wang +10RL for Language ModelsRL for Language Model Reasoning

  7. Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

    Mar 26, 2026Jiahao Wu, Ning Lu, Shengcai Liu +6RL for Language ModelsSample-Efficient RL

  8. GRRM: Group Relative Reward Modeling for Machine Translation

    Feb 15, 2026Sen Yang, Shanbo Cheng, Lu Xu +2Reward ModelingRL for Language Models

  9. Small Reward Models via Backward Inference

    Feb 14, 2026Yike Wang, Faeze Brahman, Shangbin Feng +3Reward ModelingRL for Language Models

  10. To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

    Feb 13, 2026Haoqing Wang, Xiang Long, Ziheng Li +3RL for Language ModelsGradient Interference

  11. Synthetic Interaction Data for Scalable Personalization in Large Language Models

    Feb 12, 2026Yuchen Ma, Yue Huang, Wenjie Wang +3RL for Language ModelsLLM Personalization

  12. GR2: Generative Reasoning Re-ranker

    Feb 8, 2026Mingfu Liang, Yufei Li, Jay Xu +20RL for Language ModelsLLM Reranking

  13. Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

    Jan 31, 2026Zicheng Kong, Dehua Ma, Zhenbo Xu +9Reward ModelingRL for Language Models

  14. HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

    Jan 30, 2026Weiqi Wang, Xin Liu, Binxuan Huang +13RL for Language ModelsRL for Language Model Reasoning

  15. Trust Region Masking for Long-Horizon LLM Reinforcement Learning

    Dec 28, 2025Yingru Li, Jiacai Liu, Jiawei Xu +4RL for Language ModelsReinforcement Learning

  16. Stepwise Think-Critique: Interleaved Reasoning and Self-Critique in a Single LLM

    Dec 17, 2025Jiaqi Xu, Cuiling Lan, Xuejin Chen +1LLM Self-CorrectionCoT Reasoning

  17. Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

    Nov 14, 2025Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan LiRL for Language ModelsLLM Hallucination Mitigation

  18. OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

    Oct 28, 2025Ziyou Hu, Zhengliang Shi, Minghang Zhu +5Reward ModelingRL for Language Models

  19. Strengthening LLMs for Tabular Prediction with Structural Priors

    Oct 20, 2025Pengxiang Cai, Zihao Gao, Wanchen Lian +2Tabular Foundation ModelsRL for Language Models

  20. Rethinking On-policy Optimization for Query Augmentation

    Oct 20, 2025Zhichao Xu, Shengyao Zhuang, Xueguang Ma +6RL for Language ModelsLLM Prompting

  21. CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts

    Oct 10, 2025Jiuheng Lin, Cong Jiang, Zirui Wu +2RL for Language ModelsRL for Language Model Reasoning

  22. TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance

    Oct 9, 2025Jianhui Yang, Yiming Jin, Pengkun Jiao +6RL for Language ModelsReward Shaping

  23. ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

    Aug 19, 2025Hongxin Ding, Baixiang Huang, Yue Fang +8RL for Language ModelsHealthcare

  24. Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

    Jul 29, 2025Carel van Niekerk, Renato Vukovic, Benjamin Ruppik +3RL for Language ModelsRL for Language Model Reasoning

  25. Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

    Jul 22, 2025Chuanhao Yan, Fengdi Che, Xuhan Huang +12RL for Language ModelsRL for Language Model Reasoning

  26. A Technical Survey of Reinforcement Learning Techniques for Large Language Models

    Jul 5, 2025Saksham Sahai Srivastava, Vaneet AggarwalRL for Language ModelsLLM Alignment

  27. AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training

    Date pendingZhenyu Han, Ansheng You, Haibo Wang +16RL for Language ModelsAsynchronous RL

  28. Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

    Date pendingZikang Shan, Han Zhong, Liwei Wang +1RL for Language ModelsReinforcement Learning