RL for Diffusion Models

RL: Reinforcement Learning

Latest papers 120

All topics
CardsList
  1. Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance

    May 28, 2026Shutong Ding, Zejia Zhong, Zhongyi Wang +4Diffusion GuidanceRobotic RL

  2. Explicit Critic Guidance for Aligning Diffusion Models

    May 26, 2026Zhengyang Liang, Qihang Zhang, Ceyuan YangDiffusion Model AlignmentDiffusion Model Guidance

  3. Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

    May 25, 2026Yushi Huang, Xiangxin Zhou, Ruoyu Wang +3Diffusion Model AlignmentDiffusion Model Distillation

  4. DRM: Diffusion-based Reward Model With Step-wise Guidance

    May 25, 2026Jaxon Zhang, Binxin Yang, Hubery Yin +2Diffusion Model AlignmentDiffusion Model Guidance

  5. Reinforcement Learning from Denoising Feedback

    May 25, 2026Qi He, Huan Chen, Ya Guo +3RL for Language Model ReasoningRL for Diffusion Models

  6. Score-Based One-step MeanFlow Policy Optimization

    May 22, 2026Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn +1Flow MatchingMeanFlow

  7. Stitched Value Model for Diffusion Alignment

    May 19, 2026Hyojun Go, Hyungjin Chung, Prune Truong +8Diffusion Model AlignmentDiffusion Model Guidance

  8. Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL

    May 18, 2026Junyi Wu, Weijian Luo, Haoyang Zheng +2Diffusion Model AlignmentOne-Step Generative Modeling

  9. SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

    May 18, 2026Komal Kumar, Ankan Deria, Abhishek Basu +3Diffusion Model AlignmentDiffusion Model Fine-Tuning

  10. Fine-tuning Pocket-Aware Diffusion Models via Denoising Policy Optimization

    May 17, 2026Yuan Xue, Daniel Kudenko, Megha KhoslaMolecular OptimizationDiffusion Model Fine-Tuning

  11. Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation

    May 16, 2026Shuyin Ouyang, Zhaozhi Qian, Faroq AL-Tam +2RL for Code GenerationDiffusion Guidance

  12. Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

    May 16, 2026Siqi Luo, Jianghan Shen, Yi Xin +9Hierarchical RLGroup Relative Policy Optimization

  13. Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

    May 15, 2026Xiaoxuan He, Siming Fu, Zeyue Xue +9Diffusion Model AlignmentVideo Diffusion Models

  14. Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

    May 15, 2026Renye Yan, Jikang Cheng, Shikun Sun +7Diffusion Model AlignmentDiffusion Sampling

  15. Video Models Can Reason with Verifiable Rewards

    May 14, 2026Tinghui Zhu, Sheng Zhang, James Y. Huang +5Video Diffusion ModelsRL for Video Generation

  16. Controllable Molecular Generative Foundation Models

    May 14, 2026Yihan Zhu, Yuhan Liu, Weijiang Li +2Molecular OptimizationMolecular Graph Generation

  17. CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

    May 14, 2026Zhenyang Ni, Yijiang Li, Ruochen Jiao +7Video Diffusion ModelsReinforcement Learning

  18. Image AID via continuous-time reinforcement learning

    May 13, 2026Yilie Huang, Xun Yu ZhouDiffusion Model GuidanceMasked Diffusion Models

  19. OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

    May 12, 2026Guohui Zhang, XiaoXiao Ma, Jie Huang +9Audio-Video GenerationAudio-Visual Synchronization

  20. Efficient Adjoint Matching for Fine-tuning Diffusion Models

    May 12, 2026Jeongwoo Shin, Dongsoo Shin, Yuchen Zhu +5Diffusion Model AlignmentStochastic Optimal Control

  21. Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

    May 11, 2026Haoyuan Sun, Jing Wang, Yuxin Song +9Reward HackingPreference Optimization

  22. Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

    May 11, 2026Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken +2Diffusion Model AlignmentFlow Matching

  23. Relative Score Policy Optimization for Diffusion Language Models

    May 11, 2026Zichao Yu, Shengze Xu, Bingqing Jiang +2RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  24. TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

    May 9, 2026Jiaming Li, Chenyu Zhu, Nanxi Yi +9Diffusion Model AlignmentReward Hacking

  25. NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

    May 8, 2026Wen Huang, Haoran Sun, Yongjian Guo +8Action-Conditioned Video GenerationAction-Conditioned World Models