RL for Generative Models

RL: Reinforcement Learning

Latest papers 94

All topics
CardsList
  1. READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

    Jun 22, 2026Bo Fang, Xinyao Zhang, Yuxin Song +3RL for Generative Models

  2. Precision Recall Controllable Radiology Report Generation via Hybrid Natural Language and Clinical Reward Learning

    Jun 19, 2026Ling Chen, Ruinan Jin, Jun Luo +6Radiology Report GenerationControllable Text Generation

  3. ReFPO: Reflow Regularization for Flow Matching Policy Gradients

    Jun 19, 2026Ge Wang, Yibo Peng, Fan Feng +10Policy GradientReinforcement Learning

  4. The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL

    Jun 17, 2026Nicolas Beltran-Velez, Felix Friedrich, Zhang Xiaofeng +4Flow MatchingReinforcement Learning

  5. Steering Generative Reinforcement Learning into Stable Robotic Controller

    Jun 15, 2026Yixuan Wang, Shutong Ding, Ke Hu +3Latent Action LearningRobotic RL

  6. Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

    Jun 9, 2026Zhiyuan Zhou, Andy Peng, Charles Xu +4Policy OptimizationOffline RL

  7. Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

    Jun 9, 2026Bowen Ping, Xiangxin Zhou, Penghui Qi +3RL for Video GenerationRL for Image Generation

  8. Generative Modeling of Discrete Latent Structures via Dynamic Policy Gradients

    Jun 5, 2026Stefan Ivanovic, Ge Liu, Mohammed El-KebirLatent Variable ModelsPolicy Gradient Methods

  9. AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

    Jun 5, 2026Jiazi Bu, Pengyang Ling, Yujie Zhou +8T2I GenerationGroup Relative Policy Optimization

  10. MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching

    Jun 1, 2026Jiahui Huang, Yasi Zhang, Tianyu Chen +6Multimodal Reward ModelingRL for Generative Models

  11. Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

    Jun 1, 2026Pengyang Ling, Jiazi Bu, Yujie Zhou +6Diffusion Model AlignmentGroup Relative Policy Optimization

  12. AtomComposer: Discovering Chemical Space from First Principles with Reinforcement Learning

    May 27, 2026Bjarke Hastrup, Francois Cornet, Tejs Vegge +1AI Agents for Scientific Discovery3D Molecular Generation

  13. Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

    May 26, 2026Zixuan Yang, Yiqun Chen, Wei Yang +7Open-Ended GenerationReward Modeling

  14. AdvantageFlow: Regularized Advantage-Weighted RL in Flow Models

    May 25, 2026Branislav Kveton, Anup Rao, Subhojyoti Mukherjee +2Rectified FlowRL for Image Generation

  15. GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation

    May 25, 2026Sifan Li, Yujun Cai, Hongkai Chen +1RL for Generative ModelsConditional Generation

  16. Geo-Align: Video Generation Alignment via Metric Geometry Reward

    May 22, 2026Zizun Li, Haoyu Guo, Runzhe Teng +2Camera-Controlled Video GenerationReinforcement Learning

  17. Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

    May 22, 2026Jade Zou, Tao Huang, Weijie Kong +7Diffusion Model AlignmentFlow Matching

  18. Reinforcement Learning for Graph Generation under a Hard Assortativity Constraint

    May 22, 2026Hoyun Choi, Junghyo Jo, Deok-Sun LeeGraph RewiringGraph Generation

  19. Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

    May 20, 2026Zeyuan Wang, Da Li, Yulin Chen +6Reinforcement LearningMaximum Entropy RL

  20. Memory-Augmented Reinforcement Learning Agent for CAD Generation

    May 19, 2026Yin Xiaolong, Liu Yu, Shen Jiahang +4Text-to-CAD GenerationRL for Generative Models

  21. FlowErase-RL: Rethinking Concept Erasure as Reward Optimization in Flow Matching Models

    May 19, 2026Yi Sun, Zhiqi Zhang, Xinhao Zhong +5Flow MatchingT2I Generation

  22. Generative Auto-Bidding with Unified Modeling and Exploration

    May 19, 2026Mingming Zhang, Feiqing Zhuang, Na Li +7Automated BiddingOnline Advertising

  23. Latent Action Control for Reasoning-Guided Unified Image Generation

    May 16, 2026Fuxiang Zhai, Sixiang Chen, Yingjin Li +4Unified Multimodal ModelsCompositional T2I Generation

  24. Embedding-perturbed Exploration Preference Optimization for Flow Models

    May 15, 2026Sujie Hu, Chubin Chen, Jiashu Zhu +3AI AlignmentGroup Relative Policy Optimization