RL for Generative Models

RL: Reinforcement Learning

Latest papers 94

All topics
CardsList
  1. CrystalReasoner: Reasoning and RL for Property-Conditioned Crystal Structure Generation

    May 14, 2026Yuyang Wu, Stefano Falletta, Delia McGrath +1Crystal Structure GenerationRL for Generative Models

  2. KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration

    May 14, 2026Ruicheng Zhang, Kaixi Cong, Jun Zhou +5RL for Video GenerationLong Video Generation

  3. CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

    May 14, 2026Zhenyang Ni, Yijiang Li, Ruochen Jiao +7Video Diffusion ModelsReinforcement Learning

  4. PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation

    May 14, 2026Yidong Huang, Zun Wang, Han Lin +6Physical Consistency in Video GenerationRL for Video Generation

  5. WarmPrior: Straightening Flow-Matching Policies with Temporal Priors

    May 13, 2026Sinjae Kang, Chanyoung Kim, Kaixin Wang +2Flow MatchingVisuomotor Policy Learning

  6. Learning Local Constraints for Reinforcement-Learned Content Generators

    May 13, 2026Debosmita Bhaumik, Julian Togelius, Georgios N. Yannakakis +1Constrained Generative ModelingConstrained RL

  7. Aligning Flow Map Policies with Optimal Q-Guidance

    May 12, 2026Christos Ziakas, Alessandra Russo, Avishek Joey BoseFlow MatchingPolicy Optimization

  8. Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

    May 12, 2026Alberta Longhini, David Emukpere, Jean-Michel Renders +1RL for RoboticsReinforcement Learning

  9. Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

    May 11, 2026Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken +2Diffusion Model AlignmentFlow Matching

  10. dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

    May 10, 2026Zhengyan Wan, Yidong Ouyang, Panwen Hu +1Group Relative Policy OptimizationImage Generation

  11. Generative Actor-Critic with Soft Bridge Policies

    May 9, 2026Ke He, Le He, Shunpu Tang +2Policy OptimizationMaximum Entropy RL

  12. Implicit Preference Alignment for Human Image Animation

    May 8, 2026Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng +5Human Motion GenerationHuman Avatar Animation

  13. Rollback-Free Stable Brick Structures Generation

    May 7, 2026Chenhui Xu, Ziyue Bai, Fuxun Yu +23D Shape GenerationAutoregressive Generation

  14. OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

    May 4, 2026Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal +14RL for RoboticsRL for Generative Models

  15. Protein-Conditioned Multi-Objective Reinforcement Learning for Full-Length mRNA Design

    May 2, 2026Zixi Shao, Tao Wang, Yibei Xiao +1Multi-Objective Reinforcement LearningMolecular Generation

  16. AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

    Apr 21, 2026Yiming Pan, Chengwei Hu, Xuancheng Huang +6LLM AlignmentReinforcement Learning with Verifiable Rewards

  17. Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models

    Apr 16, 2026Alexander Peysakhovich, William BermanClassifier-Free GuidanceAutoregressive Generation

  18. Correlation-Weighted Multi-Reward Optimization for Compositional Generation

    Mar 19, 2026Jungmyung Wi, Hyunsoo Kim, Donghyun KimCompositional T2I GenerationRL for Generative Models

  19. AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

    Mar 18, 2026Dailan He, Guanlin Feng, Xingtong Ge +5RL for Video GenerationStreaming Video Generation

  20. When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

    Mar 5, 2026Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna +1Reward ModelingReference-Free Evaluation

  21. Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

    Feb 6, 2026Yunze Tong, Mushui Liu, Canyu Zhao +7Flow MatchingTemporal Credit Assignment

  22. MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

    Dec 7, 2025Ruicheng Zhang, Mingyang Zhang, Jun Zhou +6Physical Consistency in Video GenerationLong-Horizon Robotic Manipulation

  23. Discrete Compositional Generation via General Soft Operators and Robust Reinforcement Learning

    Jun 20, 2025Marco Jiralerspong, Esther Derman, Danilo Vucetic +5Scientific DiscoveryGenerative Modeling