RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Cross-Entropy Games and Frost Training

    May 26, 2026Arthur Renard, Franck Gabriel, Valentin Hartmann +1RL for Language ModelsPolicy Gradient

  2. FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

    May 26, 2026Haolong Zheng, Siyin Wang, Xulin Fan +2RL for Language ModelsFew-Shot Domain Adaptation

  3. KARMA: Karma-Aligned Reward Model Adaptation

    May 26, 2026Jared Scott, Jesse RobertsReward ModelingRL for Language Models

  4. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9Multi-Objective Reinforcement LearningRL for Language Models

  5. SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation

    May 25, 2026Michael Orme, Yanchao Yu, Zhiyuan TanRL for Language ModelsLanguage Model-Based Control

  6. TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning

    May 25, 2026Muyu Pan, Shu Zhao, Nan Zhang +4RL for Language ModelsHallucination Mitigation

  7. CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents

    May 25, 2026Yihong Tang, Kehai Chen, Liang Yue +2RL for Language ModelsPersona Consistency

  8. Learning to Route Languages for Multilingual Policy Optimization

    May 25, 2026Geyang Guo, Hiromi Wakaki, Yuki Mitsufuji +2Multilingual Language ModelsRL for Language Models

  9. Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

    May 24, 2026Wenlong Deng, Jiaji Huang, Kaan Ozkara +4Reward HackingRL for Language Models

  10. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning

  11. F-TIS: Harnessing Diverse Models in Collaborative GRPO

    May 21, 2026Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer +1RL for Language ModelsCommunication-Efficient Distributed Training

  12. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1RL for Language ModelsPolicy Gradient

  13. Towards Context-Invariant Safety Alignment for Large Language Models

    May 20, 2026Yixu Wang, Yang Yao, Xin Wang +4RL for Language ModelsLLM Alignment

  14. Reinforcement Learning over Predictive Distributions for LLM Regression

    May 20, 2026Jungsoo Park, Hyungjoo Chae, Ethan Mendes +4Distributional RLRL for Language Models

  15. Reinforcing Human Behavior Simulation via Verbal Feedback

    May 19, 2026Weiwei Sun, Xuhui Zhou, Jiarui Liu +13RL for Language ModelsHuman Behavior Simulation

  16. AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning

    May 18, 2026Peilin Wu, Xinlu Zhang, Kun Wan +4RL for Language ModelsReinforcement Learning

  17. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  18. From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery

    May 14, 2026Lingzhe Zhang, Tong Jia, Yunpeng Zhai +5RL for Language ModelsLarge Language Model-Guided Optimization

  19. ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

    May 13, 2026Jianbo Lin, Xiaomin Yu, Yi Xin +7RL for Language ModelsLLM Self-Refinement

  20. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2RL for Language ModelsReinforcement Learning

  21. ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

    May 12, 2026Nirmal Patel, Fei Wang, Inderjit S. DhillonRL for Language ModelsReinforcement Learning

  22. Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

    May 12, 2026Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West +1RL for Language ModelsLLM Personalization

  23. CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

    May 12, 2026Jianghan Shen, Siqi Luo, Xinyu Cheng +6RL for Language ModelsReinforcement Learning

  24. Epistemic Uncertainty for Test-Time Discovery

    May 11, 2026Kainat Riaz, Muhammad Ahmed Mohsin, Ahsan Bilal +5RL for Language ModelsRL Exploration

  25. Compute Where it Counts: Self Optimizing Language Models

    May 11, 2026Yash Akhauri, Mohamed S. AbdelfattahLLM Inference EfficiencyRL for Language Models

  26. Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

    May 11, 2026Changhao Li, Yuchen Zhuang, Chenxiao Gao +4RL for Language ModelsInference-Time Optimization