RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. KARMA: Karma-Aligned Reward Model Adaptation

    May 26, 2026Jared Scott, Jesse RobertsReward ModelingRL for Language Models

  2. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9Multi-Objective Reinforcement LearningRL for Language Models

  3. SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation

    May 25, 2026Michael Orme, Yanchao Yu, Zhiyuan TanRL for Language ModelsLanguage Model-Based Control

  4. TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning

    May 25, 2026Muyu Pan, Shu Zhao, Nan Zhang +4RL for Language ModelsHallucination Mitigation

  5. CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents

    May 25, 2026Yihong Tang, Kehai Chen, Liang Yue +2RL for Language ModelsPersona Consistency

  6. Learning to Route Languages for Multilingual Policy Optimization

    May 25, 2026Geyang Guo, Hiromi Wakaki, Yuki Mitsufuji +2Multilingual Language ModelsRL for Language Models

  7. Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

    May 24, 2026Wenlong Deng, Jiaji Huang, Kaan Ozkara +4Reward HackingRL for Language Models

  8. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning

  9. F-TIS: Harnessing Diverse Models in Collaborative GRPO

    May 21, 2026Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer +1RL for Language ModelsCommunication-Efficient Distributed Training

  10. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1RL for Language ModelsPolicy Gradient

  11. Towards Context-Invariant Safety Alignment for Large Language Models

    May 20, 2026Yixu Wang, Yang Yao, Xin Wang +4RL for Language ModelsLLM Alignment

  12. Reinforcement Learning over Predictive Distributions for LLM Regression

    May 20, 2026Jungsoo Park, Hyungjoo Chae, Ethan Mendes +4Distributional RLRL for Language Models

  13. Reinforcing Human Behavior Simulation via Verbal Feedback

    May 19, 2026Weiwei Sun, Xuhui Zhou, Jiarui Liu +13RL for Language ModelsHuman Behavior Simulation

  14. AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning

    May 18, 2026Peilin Wu, Xinlu Zhang, Kun Wan +4RL for Language ModelsReinforcement Learning

  15. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  16. From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery

    May 14, 2026Lingzhe Zhang, Tong Jia, Yunpeng Zhai +5RL for Language ModelsLarge Language Model-Guided Optimization

  17. ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

    May 13, 2026Jianbo Lin, Xiaomin Yu, Yi Xin +7RL for Language ModelsLLM Self-Refinement

  18. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2RL for Language ModelsReinforcement Learning

  19. ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

    May 12, 2026Nirmal Patel, Fei Wang, Inderjit S. DhillonRL for Language ModelsReinforcement Learning

  20. Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

    May 12, 2026Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West +1RL for Language ModelsLLM Personalization

  21. CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

    May 12, 2026Jianghan Shen, Siqi Luo, Xinyu Cheng +6RL for Language ModelsReinforcement Learning

  22. Epistemic Uncertainty for Test-Time Discovery

    May 11, 2026Kainat Riaz, Muhammad Ahmed Mohsin, Ahsan Bilal +5RL for Language ModelsRL Exploration

  23. Compute Where it Counts: Self Optimizing Language Models

    May 11, 2026Yash Akhauri, Mohamed S. AbdelfattahLLM Inference EfficiencyRL for Language Models

  24. Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

    May 11, 2026Changhao Li, Yuchen Zhuang, Chenxiao Gao +4RL for Language ModelsInference-Time Optimization

  25. Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

    May 9, 2026Zhida He, Xiaoyu Wen, Han Qi +7RL for Language ModelsCredit Assignment in RL

  26. ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning

    May 9, 2026Chao Jin, Xinming Wei, Yinmin Zhong +6RL for Language ModelsExpert Load Balancing