RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Meta-Learning Preferences for Multilingual LLM Alignment

    Jul 14, 2026Jiaying Lin, Seongho Son, Nam Phuong Tran +3RL for Language ModelsLLM Alignment

  2. Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

    Jul 14, 2026Xinyu Tang, Qianggang Cao, Yurou Liu +13RL for Language ModelsRL for Language Model Reasoning

  3. MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

    Jul 13, 2026Junyoung Park, Namgyu Park, Sechan Lee +3RL for Language ModelsLLM Jailbreak Attacks

  4. Predictive Divergence Masks for LLM RL

    Jul 12, 2026Xiangxin Zhou, Jiarui Yao, Penghui Qi +4RL for Language ModelsReinforcement Learning

  5. GAE: Graph-Augmented Evolution for Scientific Discovery via Reinforcement Optimization

    Jul 11, 2026Xuanzhou Chen, Taoli ChengRL for Language ModelsGenetic Programming

  6. When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

    Jul 8, 2026Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang +4RL for Language ModelsToken-Level Credit Assignment

  7. Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

    Jul 7, 2026Alexander Rombach, Chantale Lauer, Nijat MehdiyevRL for Language ModelsMulti-Objective Language Model Alignment

  8. CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

    Jul 6, 2026Qiuyi Qi, Jinjian Zhang, Mutian Bao +9RL for Language ModelsLLM Planning

  9. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

    Jul 5, 2026Yujin Kim, Namgyu Ho, Sangmin Hwang +7RL for Language ModelsReinforcement Learning

  10. Aligning Language Models with Selective Prediction

    Jul 3, 2026Gaoxiang Luo, Yifan Wu, Sinian Zhang +2RL for Language ModelsLLM Alignment

  11. Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs

    Jul 3, 2026Jakob Hartmann, James Harvey, Jhonathan Navott +5RL for Language ModelsAmortized Inference

  12. Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

    Jul 3, 2026Haotian Zhou, Weiran Huang, Siqi Liu +3RL for Language ModelsRetrieval-Augmented Generation

  13. Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    Jul 2, 2026Xuqing Yang, Yi Yuan, Shanzhe Lei +1LLM Inference EfficiencyRL for Language Models

  14. Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

    Jul 1, 2026Zijian Zhang, Rizhen Hu, Athanasios Glentis +4RL for Language ModelsFine-Tuning

  15. Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

    Jun 30, 2026Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona +2RL for Language ModelsReinforcement Learning

  16. GR2 Technical Report

    Jun 30, 2026Yufei Li, Zaiwei Zhang, Mingfu Liang +68RL for Language ModelsLLM Reranking

  17. Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback

    Jun 29, 2026Ved Sriraman, Peihan Liu, Daniel Hsu +1RL for Language ModelsImitation Learning

  18. GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

    Jun 25, 2026Ting Zhou, Zhenqing Ling, Yiyang Zhao +2RL for Language ModelsLLM Alignment

  19. NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

    Jun 25, 2026Qiaobo Hao, Yangqian Wu, Shunyi Wang +5Supervised Fine-TuningRL for Language Models

  20. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

    Jun 23, 2026Wenyang Hu, Junxiang Jia, Zhen Shu +3RL for Language ModelsRL for Language Model Reasoning

  21. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

    Jun 22, 2026Hongxin Ding, Baixiang Huang, Yue Fang +6RL for Language ModelsRubric-Based RL

  22. Weight-Space Geometry of Offline Reasoning Training

    Jun 21, 2026Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov +1RL for Language ModelsDirect Preference Optimization

  23. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL