cs.LGDec 1, 2025

Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning

Authors: Sebastian Sanokowski, Kaustubh Patil, Majid Khadiv

Organizations: Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University Munich · Practical Project Student Exchange Program, Technical University Munich · MIT World Peace University

Abstract

Diffusion models provide an expressive framework for sampling from complex, unnormalized distributions. In this work, we extend Maximum Entropy Reinforcement Learning (ME-RL) to diffusion-based policies by introducing Diffusion-Augmented Markov Decision Processes (DA-MDPs). DA-MDPs interpret each reverse-diffusion transition as an individual reinforcement-learning decision, while only the final denoised action is executed in the environment. Our DA-MDPs follow from a principled derivation based on the variational-inference formulation of ME-RL. By augmenting policy and target trajectories with intermediate diffusion variables, we obtain a tractable reverse-KL upper bound via the data-processing inequality. This bound decomposes across denoising transitions, yielding diffusion-augmented variants of soft rewards, value functions, and local policy objectives. This provides a general framework for adapting ME-RL algorithms to diffusion policies while differentiating through only one diffusion transition at a time. We instantiate the framework with PPO, REPPO, and a maximum-entropy extension of WPO. Experiments demonstrate improved continuous-control performance, benefits from additional diffusion steps, and memory-efficient training. On the StackCube and PushT manipulation tasks, DA-MDP methods learn alternative successful strategies from the same initial state and achieve higher success rates and generally higher success-weighted mode entropy than the Gaussian ME-RL baseline. We also demonstrate successful training when using action chunking.

Figures & tables

Appendix figures & tables15 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Mean Flow Policy Optimization

    Apr 16, 2026Xiaoyi Dong, Xi Sheryl Zhang, Jian ChengFlow PoliciesDiffusion-Based Reinforcement Learning Methods

  2. A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

    Jul 16, 2026Zikun Zhang, Jiayuan Sheng, David D. Yao +1Diffusion-Based Reinforcement Learning MethodsScore-Based Diffusion Model