RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Weight-Space Geometry of Offline Reasoning Training

    Jun 21, 2026Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov +1RL for Language ModelsDirect Preference Optimization

  2. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL

  3. Post-Training Speech Enhancement Language Models with Perceptual Rewards

    Jun 19, 2026Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis +1Multi-Objective Reinforcement LearningRL for Language Models

  4. Learning User Simulators with Turing Rewards

    Jun 17, 2026Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu +5Reward ModelingRL for Language Models

  5. EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

    Jun 17, 2026Minseo Kim, Minjae Lee, Seunghyuk Oh +7RL for Language ModelsReinforcement Learning

  6. Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization

    Jun 17, 2026Lanqing Li, Shentong Mo, Yang Yu +1RL for Language ModelsReinforcement Learning

  7. SuCo: Sufficiency-guided Continuous Adaptive Reasoning

    Jun 16, 2026Jiahao Wang, Bingyu Liang, Chenhao Hu +5RL for Language ModelsLarge Reasoning Models

  8. GD2^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

    Jun 15, 2026Haotian Liu, Yihao Liu, Jingwei Ni +11Multi-Objective Reinforcement LearningRL for Language Models

  9. A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

    Jun 15, 2026Jianghan Shen, Siqi Luo, Yue Li +9RL for Language ModelsGroup Relative Policy Optimization

  10. Teaching agentic AI to generalize expert diagnostic reasoning in rare diseases

    Jun 15, 2026Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler +16RL for Language ModelsRare Disease Diagnosis

  11. BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

    Jun 14, 2026Ning Li, Zixuan Guo, Yan Xu +7RL for Language ModelsLLM Hallucination Mitigation

  12. AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

    Jun 14, 2026Pengfei Zhang, Hoang H Nguyen, Yutong Song +6RL for Language ModelsSpeech Processing

  13. EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

    Jun 14, 2026Rongzhi Zhu, Xiang Huang, Yuchuan Wu +8RL for Language ModelsLLM Evaluation

  14. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Multi-Objective Reinforcement LearningRL for Language Models

  15. Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

    Jun 9, 2026Guozheng Li, Xiyan Fu, Yiwen GuoRL for Language ModelsSample-Efficient RL

  16. Rethinking the Divergence Regularization in LLM RL

    Jun 8, 2026Jiarui Yao, Xiangxin Zhou, Penghui Qi +3RL for Language ModelsPolicy Optimization

  17. Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

    Jun 8, 2026Aiyuan Yang, Canbin Piao, Chengfeng Dou +25RL for Language ModelsHealthcare

  18. Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

    Jun 7, 2026Jiashun Liu, Runze Liu, Xu Wan +3RL for Language ModelsConstrained RL

  19. Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models

    Jun 7, 2026Hongwei Wang, Miao Zhou, Fengde Wang +10RL for Language ModelsVessel Trajectory Prediction

  20. CATPO: Critique-Augmented Tree Policy Optimization

    Jun 6, 2026Ayush Singh, Umang Goyal, Ankur DahiyaRL for Language ModelsReinforcement Learning

  21. LogNEO: A GPT-Neo Reinforcement Learning Framework for Accurate Real-Time Log Anomaly Detection

    Jun 6, 2026David Eje, Tanmay Sharma, Khush Patel +2RL for Language ModelsOnline Anomaly Detection

  22. Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation

    Jun 6, 2026Boxuan Lyu, Haiyue Song, Zhi Qu +3RL for Language ModelsMachine Translation

  23. SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

    Jun 5, 2026Yuchen He, Baolong Bi, Shenghua Liu +7Multi-Objective Reinforcement LearningRL for Language Models

  24. Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

    Jun 5, 2026Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta +5RL for Language ModelsLLM Tool Use