RL Fine-Tuning

RL: Reinforcement Learning

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

    Apr 1, 2026Shaopeng Fu, Xingxing Zhang, Li Dong +1RL for Code GenerationLLM Self-Refinement

  2. Constrained Group Relative Policy Optimization

    Feb 5, 2026Roger Girgis, Rodrigue de Schaetzen, Luke Rowe +3Group Relative Policy OptimizationConstrained RL

  3. QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning

    Feb 4, 2026Doyeon Lee, Eunyi Lyou, Hyunsoo Cho +3RL for Language Model ReasoningPolicy Optimization

  4. OpenTinker: Separating Concerns in Agentic Reinforcement Learning

    Jan 12, 2026Siqi Zhu, Jiaxuan YouAgentic RLLLM Agent Training

  5. Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

    Oct 11, 2025Mingyang Lyu, Yinqian Sun, Erliang Lin +4Flow MatchingRobotic Manipulation

  6. Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

    Oct 2, 2025Derek Shi, Ruben Glatt, Christine Klymko +5Video-Language ModelsRL Fine-Tuning

  7. The Three Regimes of Offline-to-Online Reinforcement Learning

    Oct 1, 2025Lu Li, Tianwei Ni, Yihao Sun +1Offline RLRL Fine-Tuning

  8. Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning

    Sep 29, 2025Xin Qiu, Yulu Gan, Conor F. Hayes +6Fine-TuningEvolutionary Optimization

  9. Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

    Aug 13, 2025Maxime Heuillet, Yufei Cui, Boxing Chen +2RL for Language Model ReasoningEfficient Language Model Training

  10. Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

    Jul 7, 2025Song Lai, Haohan Zhao, Rong Feng +9Continual Learning for LLMsLLM Post-Training

  11. Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

    Apr 7, 2025Taiwei Shi, Yiyang Wu, Linxin Song +2RL for Language Model ReasoningMathematical Reasoning