Diffusion-Based Reinforcement Learning Methods

Latest papers 49

All topics
CardsList
  1. ExploreNet: Learning Where to Explore in Diffusion GRPO

    Sep 29, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Diffusion-Based Reinforcement Learning MethodsDiffusion Models

  2. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationDiffusion-Based Reinforcement Learning Methods

  3. Performance-Preserving Online Adaptation in Social Navigation via Diffusion Steering

    Sep 21, 2026Haruto Nagahisa, Kohei Matsumoto, Yuki Hyodo +1Diffusion-Based Reinforcement Learning MethodsRobot Navigation

  4. LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

    Sep 3, 2026Sijie Wang, Zhiqiang Tan, Xinrui Yang +1Diffusion-Based Reinforcement Learning MethodsReward Gradients

  5. Multi-AUV Ad-hoc network-based Target Tracking: A Value Gradient Guidance Multi-Agent Diffusion Reinforcement Learning Approach

    Aug 12, 2026Jiaao Ma, Chuan Lin, Guangjie Han +4Multi-Agent Reinforcement LearningMulti-Uav

  6. RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

    Aug 10, 2026Yuhan Li, Fangao Zeng, Sicong Kang +7Diffusion-Based Reinforcement Learning MethodsImage Generation

  7. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1Large Language Model Reinforcement LearningAutoregressive Rollout

  8. X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

    Jul 30, 2026Tianyu Yang, Yiming Zeng, Wenzhe Cai +5Diffusion-Based Reinforcement Learning MethodsDiffusion Policies

  9. A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

    Jul 16, 2026Zikun Zhang, Jiayuan Sheng, David D. Yao +1Diffusion-Based Reinforcement Learning MethodsScore-Based Diffusion Model

  10. Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

    Jul 8, 2026Eric Zhu, Abhinav Shrivastava, Soumik MukhopadhyayDiffusion-Based Reinforcement Learning MethodsReinforcement Learning From Human Feedback

  11. SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

    Jun 30, 2026Ruikang Zhao, Zhenting Wang, Han Gao +1Diffusion Language ModelsLarge Language Model Reinforcement Learning

  12. Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

    Jun 23, 2026Sijie Wang, Zhengyu Qing, Zhiqiang Tan +6Diffusion-Based Reinforcement Learning MethodsDiffusion Language Models

  13. Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

    Jun 21, 2026Serge Thilges, Onur Celik, Denis Blessing +2Diffusion-Based Reinforcement Learning MethodsDiffusion Policies

  14. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion-Based Reinforcement Learning MethodsReinforcement Learning Post-Training

  15. Trust-Region Diffusion Policies for Massively Parallel On-Policy RL

    Jun 13, 2026Huy Le, Onur Celik, Denis Blessing +6Diffusion-Based Reinforcement Learning MethodsDiffusion Policies

  16. Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

    Jun 9, 2026Zhiyuan Zhou, Andy Peng, Charles Xu +4Flow PoliciesDiffusion-Based Reinforcement Learning Methods

  17. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6Large Language Model Reinforcement LearningDiffusion Language Models

  18. Drift Q-Learning

    May 29, 2026Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh +3Diffusion-Based Reinforcement Learning MethodsFlow Policies

  19. Explicit Critic Guidance for Aligning Diffusion Models

    May 26, 2026Zhengyang Liang, Qihang Zhang, Ceyuan YangDiffusion AlignmentDiffusion-Based Reinforcement Learning Methods

  20. Reinforcement Learning from Denoising Feedback

    May 25, 2026Qi He, Huan Chen, Ya Guo +3Large Language Model Reinforcement LearningDiffusion-Based Reinforcement Learning Methods

  21. Score-Based One-step MeanFlow Policy Optimization

    May 22, 2026Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn +1Flow PoliciesMeanflow

  22. Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

    May 15, 2026Renye Yan, Jikang Cheng, Shikun Sun +7Diffusion-Based Reinforcement Learning MethodsReinforcement Fine-Tuning

  23. OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

    May 12, 2026Guohui Zhang, XiaoXiao Ma, Jie Huang +9Audio-Video GenerationDiffusion-Based Reinforcement Learning Methods

  24. dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

    May 10, 2026Zhengyan Wan, Yidong Ouyang, Panwen Hu +1Flow ModelsDiffusion-Based Reinforcement Learning Methods

  25. TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

    May 9, 2026Jiaming Li, Chenyu Zhu, Nanxi Yi +9Diffusion AlignmentDiffusion-Based Reinforcement Learning Methods

  26. MARBLE: Multi-Aspect Reward Balance for Diffusion RL

    May 7, 2026Canyu Zhao, Hao Chen, Yunze Tong +3Diffusion-Based Reinforcement Learning MethodsDiffusion Alignment

  27. Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

    May 7, 2026Zhikai Li, Yue Zhao, Edward Zhongwei Zhang +4Diffusion-Based Reinforcement Learning MethodsDiffusion Models

  28. FASTER: Value-Guided Sampling for Fast RL

    Apr 21, 2026Perry Dong, Alexander Swerdlow, Dorsa Sadigh +1Diffusion-Based Reinforcement Learning MethodsOffline Reinforcement Learning

  29. UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

    Apr 20, 2026Jiaqi Wang, Haoge Deng, Ting Pan +5Diffusion-Based Reinforcement Learning MethodsDiffusion Models

  30. Mean Flow Policy Optimization

    Apr 16, 2026Xiaoyi Dong, Xi Sheryl Zhang, Jian ChengFlow PoliciesDiffusion-Based Reinforcement Learning Methods

  31. Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

    Feb 4, 2026Jaemoo Choi, Yuchen Zhu, Wei Guo +6Diffusion-Based Reinforcement Learning MethodsReward Gradients

  32. ReDiF: Resource-Efficient Few-Step Diffusion Distillation via Reinforcement Learning

    Dec 28, 2025Amirhossein Tighkhorshid, Zahra Dehghanian, Hamid R. RabieeDiffusion-Based Reinforcement Learning MethodsDiffusion Sampling

  33. Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning

    Dec 1, 2025Sebastian Sanokowski, Kaustubh Patil, Majid KhadivDiffusion-Based Reinforcement Learning MethodsMarkov Decision Processes