RL Fine-Tuning

RL: Reinforcement Learning

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization

    Oct 7, 2026Haoru Li, Jinmei Liu, Zhiyong Wang +5Robot Policy GeneralizationRL Fine-Tuning

  2. VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents

    Oct 6, 2026Jiaju Chen, Min Yang, Jinghua Piao +4Token-Level Credit AssignmentCredit Assignment in RL

  3. Answer with Evidence: Consistency-Aware Grounded Visual Question Answering for Roadside Traffic Scenes

    Oct 4, 2026Runwei Guan, Rongsheng Hu, Shangshu Chen +9Autonomous Driving BenchmarksVisual Question Answering

  4. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  5. Cooperative Multi-Agent Vision-Language-Action Models via Reinforced Fine Tuning

    Sep 29, 2026Ruixiao Xu, Wong Lik Hang Kenny, Zhiqian Liu +12Vision-Language-Action ModelsVLMs for Robotics

  6. Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging

    Sep 26, 2026Jingyuan Huang, Zuming Huang, Yucheng Shi +4Language Model MergingLanguage Model Distillation

  7. Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy

    Sep 23, 2026Mehmet Turan Yardımcı, Yunus Emre ÇoğurcuRobot Policy LearningRL Exploration

  8. WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps

    Sep 22, 2026Abbas Mammadov, Jerry Y. Huang, Justin Lin +5Reinforcement LearningGenerative Flow Networks

  9. OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

    Sep 17, 2026Damiano Da Col, Maximilian Igl, Peter Karkus +5End-to-End Autonomous DrivingRL Post-Training

  10. Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

    Sep 17, 2026Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan +2Supervised Fine-TuningReinforcement Learning

  11. CellRFT: Reinforcement Fine-Tuning for Single-Cell Perturbation Modeling

    Sep 17, 2026Jie Yan, Li Liu, Hanze Guo +7Multi-Objective Reinforcement LearningSingle-Cell Perturbation Modeling

  12. Reinforcement Learning for Real-Time Vision-Language-Action Policies

    Sep 16, 2026Perry Dong, Kuo-Han Hung, Dorsa Sadigh +1Robot Policy AdaptationRobotic Manipulation

  13. TIAO: Token Importance-Aware Policy Optimization for Text Summarization

    Sep 15, 2026Qixiu Li, Chenlong Bao, Xiang Zhu +4RL for Language ModelsToken-Level Credit Assignment

  14. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

    Sep 8, 2026Hongbang Yuan, Zhuoran Jin, Yixin CaoReinforcement LearningSparse-Reward RL

  15. Risk-Conditioned Fine-Tuning of Large Language Models

    Sep 8, 2026Zixuan Liu, Fangzheng Wu, Brian Summa +1Risk-Sensitive RLLLM Safety

  16. Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification

    Sep 7, 2026Yimeng Ye, Shuang Chen, Wenxuan Huang +8Reinforcement LearningRL Fine-Tuning

  17. Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

    Sep 1, 2026Jingtan Wang, Arun Verma, Xiaoqiang Lin +4Supervised Fine-TuningLanguage Model Scaling

  18. Uncovering and Mitigating Aggregation-Induced Reward Hacking in Multi-Reward Reinforcement Learning

    Aug 31, 2026Yu Yuan, Yaoyou Fan, Lili Zhao +5Multi-Objective Reinforcement LearningReward Hacking

  19. Learning from What You Retrieve: Online RL Fine-Tuning for Semantic Retrieval

    Aug 31, 2026Shaowei Wei, Chong Huang, Songtao Fang +3Semantic SearchRL for IR

  20. Reward-guided Fine-Tuning of One-Step Generative Models via Wasserstein Gradient Flow

    Aug 30, 2026Hoseong Hwang, Woorim Han, Joungin Chun +2Image GenerationOne-Step Generative Modeling

  21. Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

    Aug 7, 2026Oseong Choi, Hoeinn Kim, Jihoon Lee +2Recommender SystemsRL Post-Training

  22. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

    Aug 4, 2026Changle Qu, Sunhao Dai, Hengyi Cai +4On-Policy Self-DistillationRL for Language Model Reasoning

  23. SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

    Aug 4, 2026Kejian Zhu, Zhuoran Jin, Shangqing Tu +5Supervised Fine-TuningGradient Interference