RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. EAGER: Enhancing Generative Event Extraction via Reinforcement Learning with Verifiable Rewards

    Sep 24, 2026Omar Adjali, Siting Liang, Omair Shahzad Bhatti +1RL for Language ModelsDocument Information Extraction

  2. Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation

    Sep 22, 2026Yanghe Dong, Wanting Huang, Weiran WangRL for Language ModelsSpeech Translation

  3. WeightBridge: An Efficient Weight Transfer Library for Reinforcement Learning

    Sep 21, 2026Xuanlin Jiang, Samuel Hsia, Michael Kuchnik +3RL for Language ModelsDistributed RL

  4. Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

    Sep 16, 2026Yizhuo Li, Jianhao Yan, Yun Luo +9RL for Language ModelsValue Function Estimation

  5. TIAO: Token Importance-Aware Policy Optimization for Text Summarization

    Sep 15, 2026Qixiu Li, Chenlong Bao, Xiang Zhu +4RL for Language ModelsToken-Level Credit Assignment

  6. Learning to Coach for Experiential Learning

    Sep 14, 2026Guanheng Chen, Tianzhu Ye, Li Dong +3RL for Language ModelsRL for Language Model Reasoning

  7. What Does an LLM Learn from Reinforcement Learning? A Mechanistic Interpretability Perspective with Fixed-SAE Track

    Sep 14, 2026Lingheng Du, Yiming Tang, Xufeng Duan +1RL for Language ModelsSparse Autoencoders

  8. GLARE: Generative Learning via Adversarial Reward Estimation For Social Dynamics Forecasting

    Sep 14, 2026Tenghao Huang, Zhaoxuan Tan, Muhao Chen +5RL for Language ModelsAdversarial Imitation Learning

  9. Direct Preference Density Alignment for Conversational Audio Equalization

    Sep 14, 2026Ioannis Stylianou, Sven Ewan Shepstone, Jon Francombe +2RL for Language ModelsLLM Alignment

  10. Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning

    Sep 14, 2026Jiayi Yuan, Hangoo Kang, James Jihao Liu +4RL for Language ModelsMulti-Objective Language Model Alignment

  11. Beyond Verified Answers: Solver-Informed Self-Distillation for Bootstrapping Operations Research Language Models

    Sep 12, 2026Rui Zhu, Minglong Cao, Chenyu Zhou +2RL for Language ModelsLarge Language Model-Guided Optimization

  12. FiMI Banking: A Sovereign Model for Indian Retail Banking

    Sep 3, 2026NPCI AI Research Team, Aman Kumar, Asit Desai +15Financial ServicesRL for Language Models

  13. PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks

    Sep 2, 2026Yuyao Zheng, Haipeng Sun, Junwei Bao +4RL for Language ModelsCredit Assignment

  14. DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation

    Sep 2, 2026Wei Zhang, Hongji Li, Song Sun +4Recommender SystemsRL for Language Models

  15. The Rise of Verbal Reinforcement Learning

    Sep 1, 2026Kshitij Tayal, Arun Sharma, Genta Indra Winata +2RL for Language ModelsReinforcement Learning

  16. PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in Insurance

    Sep 1, 2026Rohan Kirti, Akash Ghosh, Aryan Vats +5RL for Language ModelsLLM Agent Training

  17. Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO

    Sep 1, 2026Prakhar Gupta, Vaibhav GuptaRL for Language ModelsLLM Grounding

  18. Co-Evolving Actor-Conditioned Critics for Non-Verifiable Generation

    Aug 31, 2026Jinyoung Kim, Muhammad Khalifa, Lajanugen Logeswaran +4RL for Language ModelsLLM Evaluation

  19. A Survey on Rubric-Guided Reinforcement Learning for Language Models

    Aug 27, 2026Zifei Shan, Fangning ShaoRL for Language ModelsLLM Alignment

  20. ToSCA: Leveraging Hierarchical Reinforcement Learning on Temporal and Strategic Abstractions of Conversational Agents

    Aug 22, 2026Xiaoyu Wang, Qingqing Gu, Yue Zhao +5RL for Language ModelsHierarchical RL

  21. Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

    Aug 13, 2026Xinming Wang, Weinong Wang, Hongming Yang +13RL for Language ModelsLLM Alignment