RL for Diffusion Models

RL: Reinforcement Learning

Latest papers 120

All topics
CardsList
  1. Reachability-Aware Diffusion Policy Optimization

    Oct 5, 2026Hikmet Simsir, Kutay Demiray, Ozgur S. OguzConstrained RLDiffusion Policy

  2. MGPO: Manifold-Guided Diffusion Alignment for Task-Aware Dataset Distillation

    Oct 4, 2026Yunyi Chen, Chenru Wang, Xinyi Ye +2Diffusion Model AlignmentDataset Distillation

  3. Token-Level Video Reinforcement Learning

    Oct 1, 2026Yifan Wang, Gordon Guocheng Qian, Yanyu Li +2Video Diffusion ModelsRL for Video Generation

  4. iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

    Oct 1, 2026Ashok Prasad Neupane, Saugat Adhikari, Pramish Paudel +2Diffusion Model AlignmentGenerative Modeling

  5. Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

    Sep 30, 2026Yue YU, Bowen Zuo, David Crandall +2RL for Language Model ReasoningGroup Relative Policy Optimization

  6. Fork-dLLM: Avoiding the Flexibility Trap in Diffusion Language Models

    Sep 30, 2026Stipe Frković, Metod Jazbec, Christian A. NaessethMasked Diffusion ModelsSpeculative Decoding for Diffusion Language Models

  7. CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

    Sep 30, 2026Shu Yu, Chaochao LuDiffusion Model Fine-TuningCompositional T2I Generation

  8. ExploreNet: Learning Where to Explore in Diffusion GRPO

    Sep 29, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Diffusion Model Fine-TuningRL Exploration

  9. MeanFlowAdvantage: Stable Reward Fine-Tuning for Few-Step Average-Velocity Generators

    Sep 29, 2026Haocheng Tang, Tianchi Xie, Xingqiao LinFlow MatchingMeanFlow

  10. Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization

    Sep 28, 2026Zhiyuan Ma, Jiaming Li, Lingzhen Li +7Reinforcement LearningVision-Language-Action Models

  11. Principal Steering Subspaces for Online Adaptation of Frozen Generative Robot Policies

    Sep 27, 2026Jialeng Ni, Nathan Zhao, Kunpeng SongRobot Policy LearningReinforcement Learning

  12. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationAudio-Visual Alignment

  13. Informed Masking: Structure-Aware Perturbation for Reinforcement Learning in Diffusion Large Language Models

    Sep 22, 2026Xiaoyi Yu, Enver Sangineto, Pei Fu +6RL for Diffusion ModelsDiffusion Language Models

  14. DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

    Sep 10, 2026Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic +1RL for RoboticsStep-Level Credit Assignment in RL

  15. LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

    Sep 3, 2026Sijie Wang, Zhiqiang Tan, Xinrui Yang +1RL for Diffusion ModelsRL Post-Training

  16. Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

    Aug 14, 2026Yixian Xu, Yuanrui Zhang, Shengjie Luo +2Diffusion Model AlignmentPolicy Gradient Methods

  17. RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

    Aug 10, 2026Yuhan Li, Fangao Zeng, Sicong Kang +7Diffusion Model DistillationFew-Step Diffusion Sampling

  18. PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

    Aug 7, 2026Renye Yan, Jikang Cheng, You Wu +4Intrinsic Reward MethodsReinforcement Learning

  19. Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

    Aug 7, 2026Renye Yan, Jikang Cheng, You Wu +4Diffusion Model AlignmentTemporal Credit Assignment

  20. Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

    Aug 5, 2026Rohit Kumar Salla, Manoj Saravanan, Simon StepputtisDiffusion PolicyContinuous Control

  21. Latent Reward Registers for Diffusion Preference Alignment

    Aug 4, 2026Yuanshen Guan, Zipeng Feng, Chengru Song +2Diffusion Model AlignmentDiffusion Model Guidance

  22. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1RL for Language Model ReasoningRL for Diffusion Models

  23. JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

    Jul 20, 2026Ruiyi Ding, Jie Li, He Kang +3BackpropagationDiffusion Transformer

  24. Reinforcement Learning: From Algorithms To Foundation Models

    Jul 20, 2026Zihan DingReinforcement LearningRL for Video Generation

  25. Mask-Aware Policy Gradients for Diffusion Language Models

    Jul 16, 2026Haran Raajesh, Kulin Shah, Adam Klivans +1Masked Diffusion ModelsRL for Language Model Reasoning

  26. A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

    Jul 16, 2026Zikun Zhang, Jiayuan Sheng, David D. Yao +1Masked Diffusion ModelsRL for Language Model Reasoning

  27. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Jul 13, 2026Runhui Huang, Qihui Zhang, Zhe Liu +3T2I GenerationMultimodal Reward Modeling

  28. A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

    Jul 12, 2026Haitong Ma, Haldun Balim, Yang Hu +2Sim-to-Real TransferDiffusion Policy

  29. Reinforcing the Generation Order of Multimodal Masked Diffusion Models

    Jul 9, 2026Yidong Ouyang, Zhe Wang, Sourav Bhabesh +1Text-Image AlignmentRL for Diffusion Models

  30. Expressivity and Statistical Trade-offs in Diffusion Policy Learning

    Jul 8, 2026Viet Vu, Renyuan Xu, Jiacheng Zhang +1Diffusion PolicyRL for Diffusion Models

  31. Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

    Jul 8, 2026Eric Zhu, Abhinav Shrivastava, Soumik MukhopadhyayDiffusion Model AlignmentRL for Diffusion Models

  32. Self-Improving Diffusion Classifiers with Minority Preference Optimization

    Jul 4, 2026Hyunsoo Kim, Jungmyung Wi, Soobin Um +2Diffusion Model AlignmentLong-Tailed Classification

  33. Adaptive Reparametrized Time for Score-Based Diffusion Sampling

    Jul 2, 2026Yilie Huang, Wenpin Tang, Xun Yu ZhouDiffusion SamplingAdaptive Sampling

  34. PAPA: Online Personalized Active Preference Alignment

    Jul 1, 2026Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas +2Diffusion Model AlignmentDiffusion Model Fine-Tuning

  35. SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

    Jun 30, 2026Ruikang Zhao, Zhenting Wang, Han Gao +1Reinforcement LearningRL for Language Model Reasoning

  36. Diffusion Fine-tuning with Rewarded Moment Matching Distillation

    Jun 29, 2026Alexis Jacq, Guillaume Couairon, Valentin De Bortoli +3Diffusion Model DistillationDiffusion Model Fine-Tuning

  37. Qwen-Image-2.0-RL Technical Report

    Jun 25, 2026Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25Reward ModelingRL for Diffusion Models

  38. SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

    Jun 25, 2026Yankai Yang, Yancheng Long, Wei Chen +7Reward ModelingGroup Relative Policy Optimization

  39. Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

    Jun 23, 2026Sijie Wang, Zhengyu Qing, Zhiqiang Tan +6Reinforcement LearningDistributed RL

  40. Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

    Jun 22, 2026Jiawei Xu, Minghui Liu, Aakriti Agrawal +2Masked Diffusion ModelsLanguage Model Decoding

  41. Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

    Jun 21, 2026Serge Thilges, Onur Celik, Denis Blessing +2Diffusion PolicyMaximum Entropy RL

  42. Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

    Jun 21, 2026Songtao Tian, Guhan Chen, Bohan Li +2Curriculum RLFew-Step Diffusion Sampling

  43. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion TransformerRL for Image Generation

  44. Trust-Region Diffusion Policies for Massively Parallel On-Policy RL

    Jun 13, 2026Huy Le, Onur Celik, Denis Blessing +6Diffusion PolicyRL for Diffusion Models

  45. Temporal Difference Learning for Diffusion Models

    Jun 13, 2026Qizhen Ying, Yangchen Pan, Victor Adrian Prisacariu +1Few-Step Diffusion SamplingRL for Diffusion Models

  46. QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

    Jun 11, 2026Yifan Ruan, Chenyang Cao, Andreas Burger +7Inference-Time OptimizationDiffusion Policy

  47. DiPOD: Diffusion Policy Optimization without Drifting Apart

    Jun 11, 2026Haozhe Jiang, Haiwen Feng, Pieter Abbeel +3Policy Gradient MethodsRL for Diffusion Models

  48. A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding

    Jun 11, 2026Sophia Tang, Yuchen Zhu, Molei Tao +1Diffusion Model Fine-TuningDiffusion Language Model Decoding

  49. Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

    Jun 11, 2026Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai +2Multimodal ReasoningRL for Diffusion Models

  50. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6RL for Language Model ReasoningCredit Assignment in RL

  51. Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling

    May 31, 2026Guang Lin, Shikui Tu, Lei XuMolecular OptimizationDiffusion Model Fine-Tuning

  52. Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

    May 31, 2026Hikmet Simsir, Ozgur S. OguzRobot Policy AdaptationReinforcement Learning

  53. Improving Visual Representation Alignment Generation with GRPO

    May 30, 2026Shentong Mo, Sukmin YunDiffusion Model AlignmentDiffusion Transformer