RL Post-Training

RL: Reinforcement Learning

Momentum

49 papers in the last four weeks, up 206% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 309

All topics
CardsList
  1. Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

    Oct 10, 2025Xinyi Wang, Jinyi Han, Zishang Jiang +7Reinforcement LearningRL for Language Model Reasoning

  2. TripScore: Aligning LLMs for Real-World Travel Planning via Expert-Calibrated Reward

    Oct 10, 2025Yincen Qu, Huan Xiao, Feng Li +5Reward ModelingLLM Planning

  3. Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression

    Oct 2, 2025Joykirat Singh, Justin Chih-Yao Chen, Archiki Prasad +3RL for Language Model ReasoningLLM Inference Acceleration

  4. Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

    Oct 1, 2025Xin-Qiang Cai, Wei Wang, Feng Liu +3Reinforcement LearningRL for Language Model Reasoning

  5. ReST-RL: Reinforcing LLM Reasoning through Unified Self-Training and Value-Guided Search

    Aug 27, 2025Sining Zhoubian, Dan Zhang, Jie TangRL for Code GenerationRL for Language Model Reasoning

  6. Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

    Jul 29, 2025Carel van Niekerk, Renato Vukovic, Benjamin Ruppik +3RL for Language ModelsRL for Language Model Reasoning

  7. AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training

    Date pendingZhenyu Han, Ansheng You, Haibo Wang +16RL for Language ModelsAsynchronous RL