RL Fine-Tuning

RL: Reinforcement Learning

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

    Aug 2, 2026Longtian Bao, Jianyou Wang, Yang Zhang +2Synthetic Data GenerationCurriculum RL

  2. Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

    Jul 30, 2026Takumi Shioda, Kohei Terashima, Tatsuo NagaiLanguage Model-Based ControlModel-Free RL

  3. Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

    Jul 30, 2026Haodong Zhu, Yangyang Ren, Yanjing Li +4RL for Language Model ReasoningCurriculum RL

  4. Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

    Jul 29, 2026Perry Dong, Ron Polonsky, Dorsa Sadigh +1Continuous ControlRL Fine-Tuning

  5. SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

    Jul 29, 2026Jianze Wang, Kunwang Zheng, Ying Liu +5Reinforcement LearningTest-Time RL

  6. A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents

    Jul 29, 2026Zhoupeng Shou, Xiaodong Hong, Congjing Ren +3Language Model-Based ControlFeedback Control

  7. Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

    Jul 29, 2026Keegan Harris, Brian W. Lee, Ian Waudby-Smith +3Reinforcement LearningKL-Regularized RL

  8. Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

    Jul 28, 2026Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit +2Numerical Reasoning in Language ModelsLLM Interpretability

  9. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Jul 27, 2026Md Rezwanul Haque, Md. Milon Islam, Fakhri KarrayRL for Language ModelsLLM Alignment

  10. From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python

    Jul 23, 2026Muntasir Adnan, Manile Srun, Carlos C. N. KuhnSoftware Vulnerability DetectionLLMs for Cybersecurity

  11. Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

    Jul 14, 2026Takumi Shioda, Kohei Terashima, Tatsuo NagaiRL for Language Model ReasoningBuilding Energy Management

  12. A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

    Jul 14, 2026Chengguang Gan, Zhixi Cai, Yunhao Liang +3Group Relative Policy OptimizationRL Fine-Tuning

  13. Active Offline-to-Online Reinforcement Learning

    Jul 13, 2026Alper Kamil Bozkurt, Shangtong Zhang, Yuichi MotaiOffline RLRL Fine-Tuning

  14. When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

    Jul 8, 2026Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang +4RL for Language ModelsToken-Level Credit Assignment

  15. Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

    Jul 7, 2026Alexander Rombach, Chantale Lauer, Nijat MehdiyevRL for Language ModelsMulti-Objective Language Model Alignment

  16. Reinforcement Learning for Data-Efficient Code-Switched ASR

    Jul 2, 2026Ziwei Ye, Peter VickersCode-Switching Speech RecognitionAudio-Language Models

  17. Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

    Jul 1, 2026Zijian Zhang, Rizhen Hu, Athanasios Glentis +4RL for Language ModelsFine-Tuning

  18. Loss Smoothing for Stable Adaptation Under Distribution Shift

    Jul 1, 2026Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu +1Fine-TuningRL Fine-Tuning

  19. Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

    Jul 1, 2026Xuefeng Liu, Mingxuan Cao, Qinan Huang +3Molecular OptimizationLarge Language Model-Guided Optimization

  20. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

    Jun 29, 2026Haisen Luo, Yiwei Liu, Haoning Wang +13Self-Training for Language ModelsRL for Language Model Reasoning

  21. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement LearningRL for Language Model Reasoning

  22. Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition

    Jun 26, 2026Violeta Basten-Romero, Rubén Muñoz-Tafalla, Anna María Díaz-Rovira +3Protein Language ModelsProtein Design

  23. Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

    Jun 24, 2026Yupu Hao, Zhuoran Jin, Huanxuan Liao +2Supervised Fine-TuningLLM Reliability

  24. FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

    Jun 24, 2026Shuyi Zhang, Yunfan Lou, Hongyang Cheng +8RL for RoboticsVision-Language-Action Models

  25. WinDOM: Self-Family Distillation for Small-Model GUI Grounding

    Jun 24, 2026Chengheng Li-Chen, Zhiqian Zhou, Hao Chen +1Synthetic Data GenerationGUI Grounding

  26. Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

    Jun 23, 2026Marta Sumyk, Oleksandr KosovanRL for GUI AgentsRL Fine-Tuning

  27. Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

    Jun 23, 2026Haoyuan Deng, Yihong Zhou, Thomas Morstyn +1Reinforcement LearningRL Fine-Tuning