RL for Image Generation

RL: Reinforcement Learning

Latest papers 53

All topics
CardsList
  1. Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

    May 28, 2026Shufan Li, Konstantinos Kallidromitis, Akash Gokul +2Token-Level Credit AssignmentRL for Language Model Reasoning

  2. AdvantageFlow: Regularized Advantage-Weighted RL in Flow Models

    May 25, 2026Branislav Kveton, Anup Rao, Subhojyoti Mukherjee +2Rectified FlowRL for Image Generation

  3. HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

    May 23, 2026Ruyi Chen, Lu Zhou, Xiaogang Xu +3T2I GenerationAlgorithmic Fairness

  4. RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

    May 20, 2026Siyong Jian, Siyuan Li, Luyuan Zhang +5T2I GenerationRL for Image Generation

  5. Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

    May 19, 2026Junjie Wang, Xinghua Lou, Jason Li +8Image GenerationCompositional T2I Generation

  6. Generation Navigator: A State-Aware Agentic Framework for Image Generation

    May 18, 2026Jinming Liu, Ruoyu Feng, Yuqi Wang +2T2I GenerationAgentic Image Generation

  7. Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation

    May 18, 2026Baoteng Li, Xianghao Zang, Xinran Wang +8Group Relative Policy OptimizationCurriculum RL

  8. Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

    May 16, 2026Siqi Luo, Jianghan Shen, Yi Xin +9Hierarchical RLGroup Relative Policy Optimization

  9. Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

    May 14, 2026Hanbo Cheng, Limin Lin, Ruo Zhang +2Image GenerationCompositional T2I Generation

  10. When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

    May 12, 2026Xiaofeng Tan, Jun Liu, Bin-Bin Gao +5Flow MatchingGenerative Modeling

  11. Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

    May 8, 2026Juanxi Tian, Fengyuan Liu, Jiaming Han +6Policy OptimizationMultimodal Reward Modeling

  12. Flow-OPD: On-Policy Distillation for Flow Matching Models

    May 8, 2026Zhen Fang, Wenxuan Huang, Yu Zeng +8Diffusion Model AlignmentFlow Matching

  13. POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation

    Apr 27, 2026Yaohou Fan, Qingzhong Wang, Yongsong Huang +3Multi-Objective Reinforcement LearningRL for Image Generation

  14. ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

    Apr 22, 2026Shelly Golan, Michael Finkelson, Ariel Bereslavsky +2Multi-Objective Reinforcement LearningRL for Image Generation

  15. UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

    Apr 20, 2026Jiaqi Wang, Haoge Deng, Ting Pan +5T2I GenerationGroup Relative Policy Optimization

  16. FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation

    Apr 15, 2026Yongjin Kim, Yoonjin Oh, Yerin Kim +5Controllable Image GenerationCompositional T2I Generation

  17. Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

    Apr 10, 2026Zhuohan Ouyang, Zhe Qian, Wenhuo Cui +1Text-Guided Image EditingGroup Relative Policy Optimization

  18. Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

    Feb 6, 2026Yunze Tong, Mushui Liu, Canyu Zhao +7Flow MatchingTemporal Credit Assignment

  19. Understanding Reward Hacking in Text-to-Image Reinforcement Learning

    Jan 6, 2026Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou +1Reward HackingMultimodal Reward Modeling

  20. RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

    Nov 25, 2025Xuelu Feng, Yunsheng Li, Ziyu Wan +4Reward ModelingT2I Generation

  21. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Unified Multimodal ModelsT2I Generation

  22. Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models

    Sep 29, 2025Shuchen Xue, Chongjian Ge, Shilong Zhang +2Score MatchingDiffusion Model Alignment