RL Fine-Tuning

RL: Reinforcement Learning

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

    May 8, 2026Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu +1Reinforcement LearningGroup Relative Policy Optimization

  2. On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

    May 8, 2026Yuhao Li, Shengchao LiuSupervised Fine-TuningFree Energy Principle

  3. Skip What You Can Predict: Predictive Repositioning for Policy Optimization for Efficient LLM Training

    May 7, 2026Ismam Nur Swapnil, Aranya Saha, Tasneea Zahra +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  4. Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning

    May 6, 2026Alper Kamil Bozkurt, Xiaoan Xu, Shangtong Zhang +2Sequential Decision MakingRL Fine-Tuning

  5. Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL

    May 6, 2026Yaxun Dai, Baolin Sun, Junying Wang +6Credit Assignment in RLText-to-SQL

  6. CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies

    May 6, 2026Keyu Chen, Nanfei Ye, Yida Wang +4Reinforcement LearningAutonomous Driving Planning

  7. Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning

    May 6, 2026Lingzhe Zhang, Tong Jia, Yunpeng Zhai +6Reinforcement LearningRL Fine-Tuning

  8. DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

    May 5, 2026Hongbo Jin, Rongpeng Zhu, Zhongjing Du +4Token-Level Credit AssignmentRL for Language Model Reasoning

  9. OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

    May 4, 2026Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal +14RL for RoboticsRL for Generative Models

  10. Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

    May 2, 2026Yao Du, Shanshan Song, Xiaomeng LiMultimodal Large Language ModelsRL Fine-Tuning

  11. TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination

    May 1, 2026Yi Xie, Siao Liu, Falong Fan +3Multi-Agent System OptimizationMulti-Agent Coordination

  12. Iterative Finetuning is Mostly Idempotent

    May 1, 2026Zephaniah Roe, Jack Sanderson, Dang Nguyen +5Supervised Fine-TuningLLM Post-Training

  13. Distributional Alignment Games for Answer-Level Fine-Tuning

    Apr 29, 2026Mehryar Mohri, Jon Schneider, Yifan WuFine-TuningRL for Language Model Reasoning

  14. EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL

    Apr 29, 2026Jaehoon Lee, CheolWon Na, Suyoung Bae +4Reward ShapingText-to-SQL

  15. SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

    Apr 26, 2026Alexis Limozin, Eduard Durech, Torsten Hoefler +2RL for Language Model ReasoningPolicy Optimization

  16. GIFT: Global stabilisation via Intrinsic Fine Tuning

    Apr 25, 2026Rory Young, Nicolas PugeaultRL ControlReinforcement Learning

  17. RL Token: Bootstrapping Online RL with Vision-Language-Action Models

    Apr 24, 2026Charles Xu, Jost Tobias Springenberg, Michael Equi +4RL for RoboticsRobot Skill Learning

  18. Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports

    Apr 21, 2026Yishu Wei, Yi Lin, Adam Flanders +2HealthcareClinical Reasoning

  19. Bounded Ratio Reinforcement Learning

    Apr 20, 2026Yunke Ao, Le Chen, Bruce D. Lee +5Reinforcement LearningGroup Relative Policy Optimization

  20. TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning

    Apr 18, 2026Siyang Li, Yize Chen, Zijie Zhu +4Time Series ForecastingOOD Generalization

  21. AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems

    Apr 18, 2026Sumeet Ramesh Motwani, Chuan Du, Aleksander Petrov +4LLM Post-TrainingRL Fine-Tuning

  22. Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

    Apr 17, 2026Xiaoyu Yang, En Yu, Wei Duan +1Multimodal RobustnessMultimodal Large Language Models

  23. Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models

    Apr 16, 2026Alexander Peysakhovich, William BermanClassifier-Free GuidanceAutoregressive Generation