RL for Diffusion Models

RL: Reinforcement Learning

Latest papers 120

All topics
CardsList
  1. Reachability-Aware Diffusion Policy Optimization

    Oct 5, 2026Hikmet Simsir, Kutay Demiray, Ozgur S. OguzConstrained RLDiffusion Policy

  2. MGPO: Manifold-Guided Diffusion Alignment for Task-Aware Dataset Distillation

    Oct 4, 2026Yunyi Chen, Chenru Wang, Xinyi Ye +2Diffusion Model AlignmentDataset Distillation

  3. Token-Level Video Reinforcement Learning

    Oct 1, 2026Yifan Wang, Gordon Guocheng Qian, Yanyu Li +2Video Diffusion ModelsRL for Video Generation

  4. iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

    Oct 1, 2026Ashok Prasad Neupane, Saugat Adhikari, Pramish Paudel +2Diffusion Model AlignmentGenerative Modeling

  5. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2RL for Language Model ReasoningGroup Relative Policy Optimization

  6. Fork-dLLM: Avoiding the Flexibility Trap in Diffusion Language Models

    Sep 30, 2026Stipe Frković, Metod Jazbec, Christian A. NaessethMasked Diffusion ModelsSpeculative Decoding for Diffusion Language Models

  7. CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

    Sep 30, 2026Shu Yu, Chaochao LuDiffusion Model Fine-TuningCompositional T2I Generation

  8. ExploreNet: Learning Where to Explore in Diffusion GRPO

    Sep 29, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Diffusion Model Fine-TuningRL Exploration

  9. MeanFlowAdvantage: Stable Reward Fine-Tuning for Few-Step Average-Velocity Generators

    Sep 29, 2026Haocheng Tang, Tianchi Xie, Xingqiao LinFlow MatchingMeanFlow

  10. Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization

    Sep 28, 2026Zhiyuan Ma, Jiaming Li, Lingzhen Li +7Reinforcement LearningVision-Language-Action Models

  11. Principal Steering Subspaces for Online Adaptation of Frozen Generative Robot Policies

    Sep 27, 2026Jialeng Ni, Nathan Zhao, Kunpeng SongRobot Policy LearningReinforcement Learning

  12. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationAudio-Visual Alignment

  13. Informed Masking: Structure-Aware Perturbation for Reinforcement Learning in Diffusion Large Language Models

    Sep 22, 2026Xiaoyi Yu, Enver Sangineto, Pei Fu +6RL for Diffusion ModelsDiffusion Language Models

  14. DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

    Sep 10, 2026Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic +1RL for RoboticsStep-Level Credit Assignment in RL

  15. LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

    Sep 3, 2026Sijie Wang, Zhiqiang Tan, Xinrui Yang +1RL for Diffusion ModelsRL Post-Training

  16. Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

    Aug 14, 2026Yixian Xu, Yuanrui Zhang, Shengjie Luo +2Diffusion Model AlignmentPolicy Gradient Methods

  17. RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

    Aug 10, 2026Yuhan Li, Fangao Zeng, Sicong Kang +7Diffusion Model DistillationFew-Step Diffusion Sampling

  18. PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

    Aug 7, 2026Renye Yan, Jikang Cheng, You Wu +4Intrinsic Reward MethodsReinforcement Learning

  19. Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

    Aug 7, 2026Renye Yan, Jikang Cheng, You Wu +4Diffusion Model AlignmentTemporal Credit Assignment

  20. Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

    Aug 5, 2026Rohit Kumar Salla, Manoj Saravanan, Simon StepputtisDiffusion PolicyContinuous Control

  21. Latent Reward Registers for Diffusion Preference Alignment

    Aug 4, 2026Yuanshen Guan, Zipeng Feng, Chengru Song +2Diffusion Model AlignmentDiffusion Model Guidance

  22. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1RL for Language Model ReasoningRL for Diffusion Models

  23. JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

    Jul 20, 2026Ruiyi Ding, Jie Li, He Kang +3BackpropagationDiffusion Transformer

  24. Reinforcement Learning: From Algorithms To Foundation Models

    Jul 20, 2026Zihan DingReinforcement LearningRL for Video Generation

  25. Mask-Aware Policy Gradients for Diffusion Language Models

    Jul 16, 2026Haran Raajesh, Kulin Shah, Adam Klivans +1Masked Diffusion ModelsRL for Language Model Reasoning