RL for Generative Models

RL: Reinforcement Learning

Latest papers 94

All topics
CardsList
  1. Variance-Averse nn-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments

    Oct 6, 2026Guhyeon Kang, Minhae KwonDistributional RLRisk-Sensitive RL

  2. Improving Synthetic Data Generation for Argument Mining via Adversarial Reinforcement Learning

    Oct 6, 2026Zhijun Zhang, Qianlong Wang, Keyang Ding +5Adversarial TrainingArgument Mining

  3. MEND: RL For Flow Models via Proximal Velocity Matching

    Oct 5, 2026Shreshth Saini, Neil Birkbeck, Yilin Wang +2Flow MatchingRL for Image Generation

  4. Flow Matching Reinforcement for 3D Mesh Generation via Dynamic Homing Optimization

    Oct 1, 2026Zhen Zhou, Zhiwei Ning, Puhua Jiang +6Flow Matching3D Mesh Generation

  5. RankBuffer: Efficient Ranking-Based Rewards for Open-Ended Generation

    Sep 29, 2026Zixuan Yang, Yiqun Chen, Qi Liu +6Open-Ended GenerationReward Modeling

  6. Mutually Adversarial Self-Training with Evolving Data for Unified Multimodal Models

    Sep 28, 2026Wentao Zhou, Weijie Gan, Jiayun WangAdversarial TrainingUnified Multimodal Models

  7. Timestep Weighting: A Hidden Key to Effective ELBO-Based Flow-Matching RL

    Sep 26, 2026Qinwei Ma, Jingzhe Shi, Simin Fan +2RL for Image GenerationAdaptive Loss Weighting

  8. PoEM: Predicting RL Outcomes from Existing Policies

    Sep 24, 2026Kimia Hamidieh, Giannis Daras, Antonio TorralbaRL for Generative ModelsRL Post-Training

  9. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationAudio-Visual Alignment

  10. WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps

    Sep 22, 2026Abbas Mammadov, Jerry Y. Huang, Justin Lin +5Reinforcement LearningGenerative Flow Networks

  11. Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy

    Sep 11, 2026Pengfei Zhang, Teng Sun, Xianchao XiuLatent Action LearningRobot Policy Learning

  12. Tail-Likelihood Reinforcement Learning

    Sep 2, 2026Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar +11Risk-Sensitive RLRL for Generative Models

  13. HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs

    Aug 12, 2026Kangning Zhang, Haotian Fang, Xukun Luo +6Sequential RecommendationRecommender Systems

  14. Stochastic Dynamics on Persistence Diagram Space via Reinforcement Learning

    Aug 6, 2026Farzana NasrinRL for Generative ModelsPersistent Homology

  15. iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

    Aug 6, 2026Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel +2Constrained Generative ModelingAgentic RL

  16. GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

    Aug 4, 2026Guanrou Yang, Tian Tan, Qian Chen +8Flow MatchingTTS Synthesis

  17. Reinforcement Learning: From Algorithms To Foundation Models

    Jul 20, 2026Zihan DingReinforcement LearningRL for Video Generation

  18. VINE: Taming Generative Control Policies for Reinforcement Learning

    Jul 11, 2026Rushuai Yang, Zhuo Han, Houlin Li +10RL for RoboticsOffline RL

  19. Optimizing Visual Generative Models via Distribution-wise Rewards

    Jul 2, 2026Ruihang Li, Mengde Xu, Shuyang Gu +4Diffusion Model Fine-TuningRL for Image Generation

  20. FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification

    Jun 29, 2026Zheming Fu, Ruizhe He, Wei Shang +4Flow MatchingGenerative Modeling

  21. PerturbCellRL: Verifier-Guided Reinforcement Learning for Single-Cell Perturbation Prediction

    Jun 26, 2026Dongxia Wu, Mingyu Li, Yuhui Zhang +4Single-Cell Perturbation ModelingReinforcement Learning with Verifiable Rewards

  22. Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN

    Jun 25, 2026Archer Moore, Mingming Gong, Liam Hodgkinson3D Shape GenerationRL for Generative Models

  23. Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

    Jun 25, 2026Wenwang Huang, Yusen Fu, Junjie Wang +6Image GenerationRL for Generative Models

  24. Uncertainty-aware reinforcement learning for chemical language models

    Jun 23, 2026Borja Medina, Jon Paul JanetMolecular GenerationRL for Generative Models