RL for Language Models

RL: Reinforcement Learning

Latest papers 271

All topics
CardsList
  1. Marrying Pricing and Advertising with LLMs

    Oct 7, 2026Alessandro Barro, Francesco Bacchiocchi, Francesco Emanuele Stradi +1Dynamic PricingRL for Language Models

  2. RollVerify: Bridging Efficiency and Accuracy in Long-Tail Rollout Reinforcement Learning

    Oct 7, 2026Yongqiang Yao, Jinru Tan, Kaihuan Liang +5RL for Language ModelsReinforcement Learning

  3. Sherpa: Teaching LLMs to Teach Adaptively

    Oct 6, 2026Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang +2RL for Language ModelsIntelligent Tutoring Systems

  4. HiPLEX: Hierarchical Policy Factorization for Full Duplex Speech Language Models

    Oct 6, 2026Kyudan Jung, Hyunsin Park, Yoonhyung Lee +5RL for Language ModelsSpeech Language Models

  5. HuatuoGPT-3: RL-Only Domain Adaptation from Base Models

    Oct 5, 2026Junying Chen, Xinyuan Xie, Ziniu Li +7RL for Language ModelsReinforcement Learning

  6. The Asymptotics of Language Model Alignment with Memory

    Oct 1, 2026Haricharan Balasundaram, V. Arvind RameshwarRL for Language ModelsLLM Alignment

  7. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  8. Grounding Large Language Models in DSGE Simulators for Policy Generation and Forecasting

    Oct 1, 2026Aditya Dubey, Namah Gupta, Vinti AgarwalRL for Language ModelsLarge Language Model-Guided Optimization

  9. Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

    Oct 1, 2026Yu Mao, Lei Yu, Zining Zhu +6RL for Language ModelsReinforcement Learning

  10. GrammarRL: Effective Grammar-Constrained Decoding via Reinforcement Learning

    Sep 30, 2026Gabriele Tuccio, Antonino Furnari, Aldo Gangemi +1RL for Language ModelsConstrained Decoding

  11. Multi-LLM Collaborative Alignment via Stackelberg Games

    Sep 30, 2026Christina Hahn, Shangbin Feng, Dean Light +3RL for Language ModelsLLM Alignment

  12. CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

    Sep 29, 2026Wenbin Hu, Huihao Jing, Haochen Shi +3Multi-Objective Reinforcement LearningRL for Language Models

  13. VAA-CSEC: Vote-guided Advantage Allocation for Chinese Semantic Error Correction

    Sep 29, 2026Yitong Han, Nankai Lin, Juan Luo +3RL for Language ModelsSelf-Consistency in Language Models

  14. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4RL for Language ModelsReinforcement Learning

  15. Sample What You Say: Aligning Language Models to Sample the Distributions They State

    Sep 28, 2026Kasra Arabi, Virginia Smith, Chhavi YadavRL for Language ModelsGroup Relative Policy Optimization

  16. Quality Determines Direction, Length Shapes Magnitude: Length Control for Open-Ended Reinforcement Learning

    Sep 28, 2026Zijun Weng, Zhongan Bi, Xuanang Gao +5Open-Ended GenerationRL for Language Models

  17. ABC-Align: Prediction-Powered Alignment with Adaptive Bias Control

    Sep 28, 2026Eric Frankel, Banghua Zhu, Sewoong Oh +1RL for Language ModelsLLM Alignment

  18. CRISP: Cultural Reward Modeling for Implicit Situated Propriety

    Sep 28, 2026Zekun Yuan, Yangfan Ye, Baohang Li +6Reward ModelingRL for Language Models

  19. Evolving Support Priorities in Empathetic Reinforcement Learning

    Sep 28, 2026Pengyu Huang, Zhiyuan Han, Wenwen Tong +6Reward ModelingRL for Language Models

  20. GlyphBench: A Playground for Language-Model Reinforcement Learning

    Sep 28, 2026Roger Creus Castanyer, Marc-Alexandre Côté, Matthew James Sargent +3RL BenchmarksRL for Language Models

  21. TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

    Sep 27, 2026Zihan Lin, Xiaohan Wang, Jie Cao +4RL for Language ModelsRL for Language Model Reasoning

  22. COEVO: Co-Evolving Context and Parameters for Recursive Self-Improvement

    Sep 27, 2026Siwei Chen, Xinping Bao, Xinyu Cai +3RL for Language ModelsPrompt Optimization