RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

    May 8, 2026Yada Pruksachatkun, Elaine Wan, Lyanna Chen +2RL for Language ModelsLarge Language Model-Based Role-Play Simulation

  2. SEIF: Self-Evolving Reinforcement Learning for Instruction Following

    May 8, 2026Qingyu Ren, Qianyu He, Jiajie Zhu +7RL for Language ModelsReinforcement Learning

  3. HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control

    May 8, 2026Xincheng Yao, Ruoqi Li, Cheng Chen +4RL for Language ModelsExploration-Exploitation Tradeoff

  4. Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

    May 8, 2026Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3RL for Language ModelsReinforcement Learning

  5. Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

    May 8, 2026Wanli Yang, Hongyu Zang, Junwei Zhang +5RL for Language ModelsFactual Knowledge in Language Models

  6. ff-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

    May 7, 2026Di Wu, Chengshuai Shi, Jing Yang +1RL for Language ModelsRL from Human Feedback

  7. Efficiently Aligning Language Models with Online Natural Language Feedback

    May 5, 2026Christine Ye, Joe BentonReward ModelingRL for Language Models

  8. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8RL for Language ModelsLLM Evaluation

  9. ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

    May 1, 2026Zihan Lin, Xiaohan Wang, Jie Cao +6RL for Language ModelsReinforcement Learning

  10. Cost-Aware Learning

    Apr 30, 2026Clara Mohri, Amir Globerson, Haim Kaplan +2Stochastic OptimizationRL for Language Models

  11. Rethinking Agentic Reinforcement Learning In Large Language Models

    Apr 30, 2026Fangming Cui, Ruixiao Zhu, Cheng Fang +2RL for Language ModelsAgentic RL

  12. From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

    Apr 30, 2026Qingyu Ren, Tianjun Pan, Xingzhou Chen +1Reward ModelingRL for Language Models

  13. Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

    Apr 29, 2026Bolian Li, Yifan Wang, Yi Ding +3RL for Language ModelsReinforcement Learning

  14. Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

    Apr 28, 2026James Pustejovsky, Nikhil KrishnaswamyRL for Language ModelsLanguage Model Safety Evaluation

  15. BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

    Apr 27, 2026Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan +3LLM QuantizationRL for Language Models

  16. C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs

    Apr 24, 2026Rui Gao, Youngseung Jeon, Swastik Roy +2RL for Language ModelsMolecular Optimization

  17. Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

    Apr 24, 2026Haidong Yuan, Haokun Zhao, Wanshi Xu +4RL for Language ModelsLLM Alignment

  18. Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

    Apr 22, 2026Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk +4RL for Language ModelsSpeech Translation

  19. WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

    Apr 22, 2026Juyong Jiang, Chenglin Cai, Chansung Park +4RL for Code GenerationRL for Language Models

  20. R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling

    Apr 22, 2026Aijia Cheng, Kailong Wang, Ling Shi +1RL for Language ModelsLLM Interpretability

  21. EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

    Apr 21, 2026Chengjun Pan, Shichun Liu, Jiahang Lin +10RL for Language ModelsPolicy Gradient Methods

  22. CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

    Apr 20, 2026Shangyu Li, Juyong Jiang, Meibo Ren +7Code TranslationRL for Language Models

  23. SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

    Apr 20, 2026Shaowei Zhang, Faqiang Qian, Yan Chen +5RL for Language ModelsEmotion Recognition in Conversations

  24. CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

    Apr 19, 2026Ruiyao Xu, Mihir Parmar, Tiankai Yang +3RL for Language ModelsLLM Alignment

  25. A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

    Apr 19, 2026Zhiyin Yu, Yuchen Mou, Juncheng Yan +17RL for Language ModelsRL Post-Training