RL for Image Generation

RL: Reinforcement Learning

Latest papers 53

All topics
CardsList
  1. Visual Jev Rewards: Reference-Bound Verification for Multi-Subject Image Generation

    Oct 7, 2026Baoteng Li, Wenzhuo Wu, Kongming Liang +1Reward ModelingImage Generation Evaluation

  2. MEND: RL For Flow Models via Proximal Velocity Matching

    Oct 5, 2026Shreshth Saini, Neil Birkbeck, Yilin Wang +2Flow MatchingRL for Image Generation

  3. ExploreNet: Learning Where to Explore in Diffusion GRPO

    Sep 29, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Diffusion Model Fine-TuningRL Exploration

  4. Decompose Radicals, Then Reward: Fine-Grained Inspection for Accurate Chinese Text Rendering

    Sep 29, 2026Yazhen Xie, Xingsong Ye, Zhineng ChenT2I GenerationRL for Image Generation

  5. Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

    Sep 28, 2026Yijia Fan, Ziqi Huang, Zhongang Cai +5Unified Multimodal ModelsImage Generation

  6. Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts

    Sep 28, 2026Shuyue Stella Li, Xiaochuang Han, Yulia Tsvetkov +1Compositional T2I GenerationRL for Image Generation

  7. Timestep Weighting: A Hidden Key to Effective ELBO-Based Flow-Matching RL

    Sep 26, 2026Qinwei Ma, Jingzhe Shi, Simin Fan +2RL for Image GenerationAdaptive Loss Weighting

  8. WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps

    Sep 22, 2026Abbas Mammadov, Jerry Y. Huang, Justin Lin +5Reinforcement LearningGenerative Flow Networks

  9. λλ-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource

    Sep 18, 2026Yufeng Wang, Parivesh Priye, Meeshawn Marathe +1Flow MatchingT2I Generation

  10. Balancing Emotional Alignment and Semantic Consistency in Image Generation via Reinforcement Learning with Valence-Arousal Anchoring

    Sep 14, 2026Jisheng Dang, Zhenxuan Wang, Bin Li +3Conditional Image GenerationImage Generation

  11. DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

    Aug 10, 2026Mingfeng Lin, Chengfei Cai, Lin Xu +2Flow MatchingRL for Image Generation

  12. JustLLMGRPO: Radiographic Control for Chest X-Ray Generation

    Aug 8, 2026Pengxiang Cai, Xiaohan Li, Anglin Liu +3T2I GenerationRL for Image Generation

  13. ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

    Aug 5, 2026Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun +5Unified Multimodal ModelsAgentic Image Generation

  14. PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

    Jul 27, 2026Guo Tang, HongJie Luo, Tianxu Wang +2T2I GenerationRL for Image Generation

  15. ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

    Jul 21, 2026Yuan Wang, Yongchao Du, Mengting Chen +4Image GenerationRL for Image Generation

  16. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Jul 13, 2026Runhui Huang, Qihui Zhang, Zhe Liu +3T2I GenerationMultimodal Reward Modeling

  17. Optimizing Visual Generative Models via Distribution-wise Rewards

    Jul 2, 2026Ruihang Li, Mengde Xu, Shuyang Gu +4Diffusion Model Fine-TuningRL for Image Generation

  18. NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

    Jun 26, 2026Tianlin Pan, Lianyu Pang, Cheng Da +4Flow MatchingRL for Image Generation

  19. PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation

    Jun 25, 2026Xiaomin Li, Qian Liang, Yinan Li +5Group Relative Policy OptimizationImage Generation

  20. SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

    Jun 25, 2026Yankai Yang, Yancheng Long, Wei Chen +7Reward ModelingGroup Relative Policy Optimization

  21. Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

    Jun 19, 2026Yuanhao Chiang, Hongbo Duan, Chunru Yang +3T2I GenerationGroup Relative Policy Optimization

  22. The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL

    Jun 17, 2026Nicolas Beltran-Velez, Felix Friedrich, Zhang Xiaofeng +4Flow MatchingReinforcement Learning

  23. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion TransformerRL for Image Generation

  24. InterleaveThinker: Reinforcing Agentic Interleaved Generation

    Jun 11, 2026Dian Zheng, Harry Lee, Manyuan Zhang +4Agentic Image GenerationMultimodal Generation

  25. Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

    Jun 9, 2026Bowen Ping, Xiangxin Zhou, Penghui Qi +3RL for Video GenerationRL for Image Generation

  26. AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

    Jun 5, 2026Jiazi Bu, Pengyang Ling, Yujie Zhou +8T2I GenerationGroup Relative Policy Optimization

  27. Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

    May 28, 2026Shufan Li, Konstantinos Kallidromitis, Akash Gokul +2Token-Level Credit AssignmentRL for Language Model Reasoning

  28. AdvantageFlow: Regularized Advantage-Weighted RL in Flow Models

    May 25, 2026Branislav Kveton, Anup Rao, Subhojyoti Mukherjee +2Rectified FlowRL for Image Generation

  29. HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

    May 23, 2026Ruyi Chen, Lu Zhou, Xiaogang Xu +3T2I GenerationAlgorithmic Fairness

  30. RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

    May 20, 2026Siyong Jian, Siyuan Li, Luyuan Zhang +5T2I GenerationRL for Image Generation

  31. Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

    May 19, 2026Junjie Wang, Xinghua Lou, Jason Li +8Image GenerationCompositional T2I Generation

  32. Generation Navigator: A State-Aware Agentic Framework for Image Generation

    May 18, 2026Jinming Liu, Ruoyu Feng, Yuqi Wang +2T2I GenerationAgentic Image Generation

  33. Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation

    May 18, 2026Baoteng Li, Xianghao Zang, Xinran Wang +8Group Relative Policy OptimizationCurriculum RL

  34. Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

    May 16, 2026Siqi Luo, Jianghan Shen, Yi Xin +9Hierarchical RLGroup Relative Policy Optimization

  35. Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

    May 14, 2026Hanbo Cheng, Limin Lin, Ruo Zhang +2Image GenerationCompositional T2I Generation

  36. When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

    May 12, 2026Xiaofeng Tan, Jun Liu, Bin-Bin Gao +5Flow MatchingGenerative Modeling

  37. Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

    May 8, 2026Juanxi Tian, Fengyuan Liu, Jiaming Han +6Policy OptimizationMultimodal Reward Modeling

  38. Flow-OPD: On-Policy Distillation for Flow Matching Models

    May 8, 2026Zhen Fang, Wenxuan Huang, Yu Zeng +8Diffusion Model AlignmentFlow Matching

  39. POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation

    Apr 27, 2026Yaohou Fan, Qingzhong Wang, Yongsong Huang +3Multi-Objective Reinforcement LearningRL for Image Generation

  40. ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

    Apr 22, 2026Shelly Golan, Michael Finkelson, Ariel Bereslavsky +2Multi-Objective Reinforcement LearningRL for Image Generation

  41. UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

    Apr 20, 2026Jiaqi Wang, Haoge Deng, Ting Pan +5T2I GenerationGroup Relative Policy Optimization

  42. FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation

    Apr 15, 2026Yongjin Kim, Yoonjin Oh, Yerin Kim +5Controllable Image GenerationCompositional T2I Generation

  43. Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

    Apr 10, 2026Zhuohan Ouyang, Zhe Qian, Wenhuo Cui +1Text-Guided Image EditingGroup Relative Policy Optimization

  44. Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

    Feb 6, 2026Yunze Tong, Mushui Liu, Canyu Zhao +7Flow MatchingTemporal Credit Assignment

  45. Understanding Reward Hacking in Text-to-Image Reinforcement Learning

    Jan 6, 2026Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou +1Reward HackingMultimodal Reward Modeling

  46. RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

    Nov 25, 2025Xuelu Feng, Yunsheng Li, Ziyu Wan +4Reward ModelingT2I Generation

  47. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Unified Multimodal ModelsT2I Generation

  48. Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models

    Sep 29, 2025Shuchen Xue, Chongjian Ge, Shilong Zhang +2Score MatchingDiffusion Model Alignment