RL Fine-Tuning

RL: Reinforcement Learning

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 162

All topics
CardsList
  1. HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning

    Jun 22, 2026Jingyi Liu, Zhaohong Mai, ShunSen He +5RL for RoboticsVision-Language-Action Models

  2. DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

    Jun 17, 2026Calvin Luo, Chen Sun, Shuran SongRobot Policy AdaptationRobotic RL

  3. Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

    Jun 15, 2026Tongyan Fang, Siyuan Huang, Naiyu Fang +6Credit Assignment in RLRobotic RL

  4. StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling

    Jun 13, 2026Jiajun Li, Yu Ding, Shisi Guan +2Reinforcement LearningLarge Language Model-Guided Optimization

  5. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5RL for Language Model ReasoningLLM Inference Acceleration

  6. GUI-AC: Enhancing Continual Learning in GUI Agents

    Jun 9, 2026Can Lin, Tao Feng, Hangjie Yuan +3Non-Stationary RLRL for GUI Agents

  7. Emergence of Context Characteristics Sensitivity in Large Language Models

    Jun 8, 2026Nadya Yuki Wangsajaya, Haeun Yu, Isabelle AugensteinLLM Fine-TuningInstruction Tuning

  8. From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

    Jun 8, 2026Jike Zhong, Yuxiang Lai, Ming Li +5Theory of MindRL for Language Model Reasoning

  9. Reinforcement Learning for Flow-Matching Policies with Density Transport

    Jun 7, 2026Boshu Lei, Kostas Daniilidis, Antonio LoquercioFlow MatchingRobotic RL

  10. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  11. TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization

    Jun 4, 2026Liting Zhang, Shiwan Zhao, Xuyang Zhao +3RL for Language Model ReasoningRL Fine-Tuning

  12. FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

    Jun 3, 2026Yihao Wu, He Zhang, Junbo Tan +2Offline RLVision-Language-Action Models

  13. Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO

    Jun 1, 2026Tianyang Chen, Wenjun Li, Xin zhou +2UAV NavigationGroup Relative Policy Optimization

  14. Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

    Jun 1, 2026Christian Scherer, Joe Watson, Theo Gruner +3Reinforcement LearningRobot Skill Learning

  15. DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

    May 29, 2026Jian Mu, Tianyi Lin, Chengwei Qin +2Supervised Fine-TuningRL for Language Models

  16. DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

    May 29, 2026Yujie Wang, Siwei Chen, Longzan Luo +4RL for Language ModelsReinforcement Learning

  17. Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

    May 29, 2026Yanjiang Liu, Jie Lou, Xinyan Guan +7CoT DistillationLanguage Model Distillation

  18. Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

    May 27, 2026Saurabh Dash, Pierre Clavier, John Dang +4Reinforcement LearningInstruction Following

  19. DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

    May 27, 2026Caijun Xu, Changyi Xiao, Zhongyuan Peng +1LLM Self-CorrectionRL for Language Model Reasoning

  20. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Reinforcement LearningKL-Regularized RL

  21. Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

    May 26, 2026Zixuan Yang, Yiqun Chen, Wei Yang +7Open-Ended GenerationReward Modeling

  22. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9Multi-Objective Reinforcement LearningRL for Language Models

  23. Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring

    May 25, 2026Zhengyang Wang, Sanwoo Lee, Jiaxin Wang +3Automated Essay ScoringLanguage Model Post-Training