RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

    Jun 4, 2026Jonathan von Rad, Louis Arts, George Burgess +6Multilingual Language Model EvaluationRL for Language Models

  2. Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation

    Jun 4, 2026Hanxu Hu, Zdeněk Šnajdr, Pinzhen Chen +2RL for Language ModelsIn-Context Learning

  3. When AI Says It Feels

    Jun 4, 2026Shin-nosuke Ishikawa, Seiya Ikeda, Hirotsugu OhbaRL for Language Models

  4. SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

    Jun 3, 2026Jingyao Wu, Ashley Wang, Keane Ong +2RL for Language ModelsLLM Alignment

  5. Alpha-RTL: Test-Time Training for RTL Hardware Optimization

    Jun 3, 2026Peilong Zhou, Zhirong Chen, Cangyuan Li +4RL for Language ModelsTest-Time Optimization

  6. Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

    Jun 3, 2026Xuekang Wang, Zhuoyuan Hao, Shuo Hou +3Reward HackingRL for Language Models

  7. Large Language Models Hack Rewards, and Society

    Jun 2, 2026Wei Liu, Xinyi Mou, Hanqi Yan +2Reward HackingRL for Language Models

  8. Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

    Jun 2, 2026Can Lv, Mingju Chen, Heng Chang +1Reward ModelingRL for Language Models

  9. Experience-Driven Dynamic Exits for LLMs with Reinforcement Learning

    Jun 2, 2026Yanyu Zhu, Hoilam Pao, Niu Hu +6RL for Language ModelsSpeculative Decoding

  10. Efficient Hyperparameter Optimization for LLM Reinforcement Learning

    Jun 2, 2026Minping Chen, Bowen Xiao, Du Liang +2RL for Language ModelsRL Post-Training

  11. A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

    Jun 1, 2026Lei Yang, Siyu Ding, Deyi XiongRL for Language ModelsReinforcement Learning

  12. AgentPLM: Agentic Protein Language Models with Reasoning-Augmented Decoding for Protein Sequence Design

    Jun 1, 2026Sahil Rahman, Maxx Richard RahmanRL for Language ModelsDirect Preference Optimization

  13. LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

    May 29, 2026Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson +1RL for Language ModelsCredit Assignment in RL

  14. DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

    May 29, 2026Jian Mu, Tianyi Lin, Chengwei Qin +2Supervised Fine-TuningRL for Language Models

  15. Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards

    May 29, 2026Magnus Jørgenvåg, David Kaczér, Lasse Ruttert +3RL for Language ModelsLLM Alignment

  16. DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

    May 29, 2026Yujie Wang, Siwei Chen, Longzan Luo +4RL for Language ModelsReinforcement Learning

  17. EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

    May 28, 2026Xin Guan, Xiaomeng Hu, Shen Huang +6Open-Ended GenerationRL for Language Models

  18. Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

    May 28, 2026Zizhe Chen, Jiqian Dong, Yizhou Tian +4RL for Language ModelsValue Function Estimation

  19. LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

    May 28, 2026Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu +5RL for Language ModelsTerminal Agents

  20. Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation

    May 28, 2026Zeli Su, Ziyin Zhang, Zewei Pan +8RL for Language ModelsLow-Resource Language Processing

  21. When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

    May 28, 2026Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski +1RL for Language ModelsRL for Language Model Reasoning

  22. RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains

    May 27, 2026Haoxiang Jiang, Zihan Dong, Tianci Liu +5Reward ModelingRL for Language Models

  23. Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

    May 27, 2026Max Lamparth, Daniel Fein, Andreas Haupt +2Reward ModelingRL for Language Models