RL for Diffusion Models

RL: Reinforcement Learning

Latest papers 120

All topics
CardsList
  1. A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

    Jul 16, 2026Zikun Zhang, Jiayuan Sheng, David D. Yao +1Masked Diffusion ModelsRL for Language Model Reasoning

  2. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Jul 13, 2026Runhui Huang, Qihui Zhang, Zhe Liu +3T2I GenerationMultimodal Reward Modeling

  3. A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

    Jul 12, 2026Haitong Ma, Haldun Balim, Yang Hu +2Sim-to-Real TransferDiffusion Policy

  4. Reinforcing the Generation Order of Multimodal Masked Diffusion Models

    Jul 9, 2026Yidong Ouyang, Zhe Wang, Sourav Bhabesh +1Text-Image AlignmentRL for Diffusion Models

  5. Expressivity and Statistical Trade-offs in Diffusion Policy Learning

    Jul 8, 2026Viet Vu, Renyuan Xu, Jiacheng Zhang +1Diffusion PolicyRL for Diffusion Models

  6. Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

    Jul 8, 2026Eric Zhu, Abhinav Shrivastava, Soumik MukhopadhyayDiffusion Model AlignmentRL for Diffusion Models

  7. Self-Improving Diffusion Classifiers with Minority Preference Optimization

    Jul 4, 2026Hyunsoo Kim, Jungmyung Wi, Soobin Um +2Diffusion Model AlignmentLong-Tailed Classification

  8. Adaptive Reparametrized Time for Score-Based Diffusion Sampling

    Jul 2, 2026Yilie Huang, Wenpin Tang, Xun Yu ZhouDiffusion SamplingAdaptive Sampling

  9. PAPA: Online Personalized Active Preference Alignment

    Jul 1, 2026Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas +2Diffusion Model AlignmentDiffusion Model Fine-Tuning

  10. SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

    Jun 30, 2026Ruikang Zhao, Zhenting Wang, Han Gao +1Reinforcement LearningRL for Language Model Reasoning

  11. Diffusion Fine-tuning with Rewarded Moment Matching Distillation

    Jun 29, 2026Alexis Jacq, Guillaume Couairon, Valentin De Bortoli +3Diffusion Model DistillationDiffusion Model Fine-Tuning

  12. Qwen-Image-2.0-RL Technical Report

    Jun 25, 2026Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25Reward ModelingRL for Diffusion Models

  13. SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

    Jun 25, 2026Yankai Yang, Yancheng Long, Wei Chen +7Reward ModelingGroup Relative Policy Optimization

  14. Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

    Jun 23, 2026Sijie Wang, Zhengyu Qing, Zhiqiang Tan +6Reinforcement LearningDistributed RL

  15. Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

    Jun 22, 2026Jiawei Xu, Minghui Liu, Aakriti Agrawal +2Masked Diffusion ModelsLanguage Model Decoding

  16. Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

    Jun 21, 2026Serge Thilges, Onur Celik, Denis Blessing +2Diffusion PolicyMaximum Entropy RL

  17. Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

    Jun 21, 2026Songtao Tian, Guhan Chen, Bohan Li +2Curriculum RLFew-Step Diffusion Sampling

  18. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion TransformerRL for Image Generation

  19. Trust-Region Diffusion Policies for Massively Parallel On-Policy RL

    Jun 13, 2026Huy Le, Onur Celik, Denis Blessing +6Diffusion PolicyRL for Diffusion Models

  20. Temporal Difference Learning for Diffusion Models

    Jun 13, 2026Qizhen Ying, Yangchen Pan, Victor Adrian Prisacariu +1Few-Step Diffusion SamplingRL for Diffusion Models

  21. QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

    Jun 11, 2026Yifan Ruan, Chenyang Cao, Andreas Burger +7Inference-Time OptimizationDiffusion Policy

  22. DiPOD: Diffusion Policy Optimization without Drifting Apart

    Jun 11, 2026Haozhe Jiang, Haiwen Feng, Pieter Abbeel +3Policy Gradient MethodsRL for Diffusion Models

  23. A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding

    Jun 11, 2026Sophia Tang, Yuchen Zhu, Molei Tao +1Diffusion Model Fine-TuningDiffusion Language Model Decoding

  24. Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

    Jun 11, 2026Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai +2Multimodal ReasoningRL for Diffusion Models

  25. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6RL for Language Model ReasoningCredit Assignment in RL

  26. Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling

    May 31, 2026Guang Lin, Shikui Tu, Lei XuMolecular OptimizationDiffusion Model Fine-Tuning

  27. Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

    May 31, 2026Hikmet Simsir, Ozgur S. OguzRobot Policy AdaptationReinforcement Learning

  28. Improving Visual Representation Alignment Generation with GRPO

    May 30, 2026Shentong Mo, Sukmin YunDiffusion Model AlignmentDiffusion Transformer