RL Fine-Tuning

RL: Reinforcement Learning

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

    May 23, 2026Shresth Verma, Mauricio Tec, Cheol Woo Kim +2Synthetic Data AugmentationOffline RL

  2. Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

    May 21, 2026Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen +4Supervised Fine-TuningMechanistic Interpretability

  3. One-Way Policy Optimization for Self-Evolving LLMs

    May 21, 2026Shuo Yang, Jinda Lu, Kexin Huang +6Policy OptimizationReinforcement Learning with Verifiable Rewards

  4. PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment

    May 20, 2026Richa Verma, Bavish Kulur, Sanjay Chawla +1Direct Preference OptimizationConstrained RL

  5. AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

    May 20, 2026Miaobo Hu, Shuhao Hu, Bokun Wang +5RL for Language Model ReasoningGroup Relative Policy Optimization

  6. General Preference Reinforcement Learning

    May 18, 2026Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal +5Multi-Objective Language Model AlignmentRL Fine-Tuning

  7. Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

    May 18, 2026Soheyl Massoudi, Gabriel Apaza, Milad Habibi +1RL for Code GenerationLLM-Based Program Synthesis

  8. FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

    May 18, 2026Xikai Zhang, Yongzhi Li, Likang Xiao +6RL for Language Model ReasoningRL Exploration

  9. DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

    May 17, 2026Sixu Lin, Yunpeng Qing, Litao Liu +4Vision-Language-Action ModelsMulti-Task RL

  10. Reference-Free Reinforcement Learning Fine-Tuning for MT: A Seq2Seq Perspective

    May 15, 2026Ernesto Garcia-Estrada, Carlos Escolano, José A. R. FonallosaGroup Relative Policy OptimizationLow-Resource MT

  11. From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

    May 15, 2026Yuyuan Liu, Yiping Ji, Anjie Le +6Vision-Language GroundingVisual Grounding

  12. Embedding-perturbed Exploration Preference Optimization for Flow Models

    May 15, 2026Sujie Hu, Chubin Chen, Jiashu Zhu +3AI AlignmentGroup Relative Policy Optimization

  13. From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery

    May 14, 2026Lingzhe Zhang, Tong Jia, Yunpeng Zhai +5RL for Language ModelsLarge Language Model-Guided Optimization

  14. Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

    May 14, 2026Zeli Su, Ziyin Zhang, Zhou Liu +7Reinforcement LearningLow-Resource MT

  15. What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

    May 13, 2026Yuanfang Peng, Jingjing Fu, Chuheng Zhang +6VLM RobustnessDomain Generalization

  16. Discrete Flow Matching for Offline-to-Online Reinforcement Learning

    May 12, 2026Fairoz Nower Khan, Nabuat Zaman Nahim, Peizhong JuFlow MatchingReinforcement Learning

  17. PriorZero: Bridging Language Priors and World Models for Decision Making

    May 12, 2026Junyu Xiong, Yuan Pu, Jia Tang +1LLM-Guided RLLatent World Models

  18. TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

    May 12, 2026Matthew M. Hong, Jesse Zhang, Anusha Nagabandi +1Robot Policy AdaptationRobot Skill Learning

  19. Not How Many, But Which: Parameter Placement in Low-Rank Adaptation

    May 12, 2026Arijit Sehanobish, Charles LoveringAdapter TuningLow-Rank Adaptation

  20. Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

    May 12, 2026Alberta Longhini, David Emukpere, Jean-Michel Renders +1RL for RoboticsReinforcement Learning

  21. Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

    May 11, 2026Han Zheng, Yining Ma, Karthick Gunasekaran +4Reinforcement LearningMeta-Learning

  22. STEPS: Selective On-Policy Self-Distillation for Reasoning

    May 11, 2026Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen +2On-Policy Self-DistillationRL for Language Model Reasoning

  23. Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning

    May 10, 2026Meng Lou, Hanzhong Guo, Linwei Chen +1Class-Incremental LearningDomain-Incremental Learning

  24. MARLaaS: Multi-Tenant Asynchronous Reinforcement Learning as a Service

    May 8, 2026Timothy Tin Long Yu, Gursimran Singh, Ge Shi +3Asynchronous RLReinforcement Learning

  25. OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control

    May 8, 2026Darryl Jacob, Xinyu Liu, Muchao Ye +2Reward ShapingLanguage Model-Based Control