RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

    Apr 24, 2026Jichao Wang, Liuyang Bian, Yufeng Zhou +9RL for GUI AgentsCredit Assignment in RL

  2. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  3. Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

    Apr 23, 2026Jingkun Chen, Ruoshi Xu, Mingqi Gao +23D Spatial ReasoningVLM Hallucination

  4. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  5. SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  6. ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

    Apr 22, 2026Wentao Yan, Shengqin Wang, Huichi Zhou +4Multimodal IRProcess Reward Models

  7. Video-ToC: Video Tree-of-Cue Reasoning

    Apr 22, 2026Qizhong Tan, Zhuotao Tian, Guangming Lu +2Video ReasoningVLM Reasoning

  8. HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

    Apr 22, 2026Tao Cheng, Shi-Zhe Chen, Hao Zhang +3Multimodal Large Language ModelsMultimodal Reasoning

  9. Visual Reasoning through Tool-supervised Reinforcement Learning

    Apr 21, 2026Qihua Dong, Gozde Sahin, Pei Wang +4Tool Use in VLMsVLM Reasoning

  10. Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

    Apr 21, 2026Chuou Xu, Liya Ji, Qifeng ChenLarge Vision-Language ModelsVLM Reasoning

  11. EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

    Apr 20, 2026Yongrui Heng, Chaoya Jiang, Han Yang +2Synthetic Data GenerationMultimodal Large Language Models

  12. RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

    Apr 19, 2026Gaozhi Zhou, Hu He, Peng Shen +8Remote Sensing Image UnderstandingVisual Question Answering

  13. Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception

    Apr 19, 2026Ashutosh Bajpai, Tamal Majumder, Akshay Nambi +1Reinforcement LearningTool-Using Vision-Language Agents

  14. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Reinforcement LearningRL Post-Training

  15. EasyVideoR1: Easier RL for Video Understanding

    Apr 18, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement LearningVideo-Language Models

  16. Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

    Apr 18, 2026Xudong Li, Jiaxi Tan, Ziyin Zhou +6Tool Use in VLMsMultimodal CoT Reasoning

  17. S-GRPO: Unified Post-Training for Large Vision-Language Models

    Apr 17, 2026Yuming Yan, Kai Tang, Sihong Chen +4VLM AdaptationGroup Relative Policy Optimization

  18. Targeted Exploration via Unified Entropy Control for Reinforcement Learning

    Apr 16, 2026Chen Wang, Lai Wei, Yanzhi Zhang +5Reinforcement LearningRL for Language Model Reasoning

  19. Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

    Apr 16, 2026Yixu Huang, Tinghui Zhu, Muhao ChenEfficient VLM InferenceVisual Reasoning

  20. Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

    Apr 8, 2026Mengdan Zhu, Senhao Cheng, Liang ZhaoVLM InterpretabilityLatent Visual Reasoning

  21. TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

    Mar 29, 2026Guoli Jia, Yisheng Zhang, Haote Hu +11Tool-Using Vision-Language AgentsImage Restoration

  22. VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

    Mar 26, 2026Zhe Gao, Shiyu Shen, Taifeng Chai +7Tool Use in VLMsEfficient VLM Inference

  23. Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

    Mar 21, 2026Huan Zheng, Yucheng Zhou, Tianyi Yan +6EndoscopyMedical Diagnosis

  24. From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

    Mar 16, 2026Yibin Liu, Yaxing Lyu, Daqi Gao +5RoboticsRobotic Manipulation

  25. Are Video Reasoning Models Ready to Go Outside?

    Mar 11, 2026Yangfan He, Changgyu Boo, Jaehong YoonVLM RobustnessVideo Reasoning

  26. Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

    Mar 5, 2026Shan Ning, Longtian Qiu, Xuming HeVisual Question AnsweringReinforcement Learning