RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Post-Training Speech Enhancement Language Models with Perceptual Rewards

    Jun 19, 2026Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis +1Multi-Objective Reinforcement LearningRL for Language Models

  2. Learning User Simulators with Turing Rewards

    Jun 17, 2026Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu +5Reward ModelingRL for Language Models

  3. EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

    Jun 17, 2026Minseo Kim, Minjae Lee, Seunghyuk Oh +7RL for Language ModelsReinforcement Learning

  4. Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization

    Jun 17, 2026Lanqing Li, Shentong Mo, Yang Yu +1RL for Language ModelsReinforcement Learning

  5. SuCo: Sufficiency-guided Continuous Adaptive Reasoning

    Jun 16, 2026Jiahao Wang, Bingyu Liang, Chenhao Hu +5RL for Language ModelsLarge Reasoning Models

  6. GD2^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

    Jun 15, 2026Haotian Liu, Yihao Liu, Jingwei Ni +11Multi-Objective Reinforcement LearningRL for Language Models

  7. A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

    Jun 15, 2026Jianghan Shen, Siqi Luo, Yue Li +9RL for Language ModelsGroup Relative Policy Optimization

  8. Teaching agentic AI to generalize expert diagnostic reasoning in rare diseases

    Jun 15, 2026Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler +16RL for Language ModelsRare Disease Diagnosis

  9. BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

    Jun 14, 2026Ning Li, Zixuan Guo, Yan Xu +7RL for Language ModelsLLM Hallucination Mitigation

  10. AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

    Jun 14, 2026Pengfei Zhang, Hoang H Nguyen, Yutong Song +6RL for Language ModelsSpeech Processing

  11. EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

    Jun 14, 2026Rongzhi Zhu, Xiang Huang, Yuchuan Wu +8RL for Language ModelsLLM Evaluation

  12. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Multi-Objective Reinforcement LearningRL for Language Models

  13. Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

    Jun 9, 2026Guozheng Li, Xiyan Fu, Yiwen GuoRL for Language ModelsSample-Efficient RL

  14. Rethinking the Divergence Regularization in LLM RL

    Jun 8, 2026Jiarui Yao, Xiangxin Zhou, Penghui Qi +3RL for Language ModelsPolicy Optimization

  15. Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

    Jun 8, 2026Aiyuan Yang, Canbin Piao, Chengfeng Dou +25RL for Language ModelsHealthcare

  16. Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

    Jun 7, 2026Jiashun Liu, Runze Liu, Xu Wan +3RL for Language ModelsConstrained RL

  17. Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

    Jun 7, 2026Hongwei Wang, Miao Zhou, Fengde Wang +10RL for Language ModelsVessel Trajectory Prediction

  18. CATPO: Critique-Augmented Tree Policy Optimization

    Jun 6, 2026Ayush Singh, Umang Goyal, Ankur DahiyaRL for Language ModelsReinforcement Learning

  19. LogNEO: A GPT-Neo Reinforcement Learning Framework for Accurate Real-Time Log Anomaly Detection

    Jun 6, 2026David Eje, Tanmay Sharma, Khush Patel +2RL for Language ModelsOnline Anomaly Detection

  20. Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation

    Jun 6, 2026Boxuan Lyu, Haiyue Song, Zhi Qu +3RL for Language ModelsMachine Translation

  21. SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

    Jun 5, 2026Yuchen He, Baolong Bi, Shenghua Liu +7Multi-Objective Reinforcement LearningRL for Language Models

  22. Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

    Jun 5, 2026Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta +5RL for Language ModelsLLM Tool Use

  23. Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

    Jun 4, 2026Jonathan von Rad, Louis Arts, George Burgess +6Multilingual Language Model EvaluationRL for Language Models

  24. Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation

    Jun 4, 2026Hanxu Hu, Zdeněk Šnajdr, Pinzhen Chen +2RL for Language ModelsIn-Context Learning