RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

    Aug 2, 2026Xinheng Han, Jianfei Wang, Yu Chen +4Multimodal GroundingGroup Relative Policy Optimization

  2. RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

    Aug 2, 2026Damir Nurtdinov, Alexei Kornaev, Alexander MaloletovRobot Skill LearningCross-Embodiment Robot Learning

  3. WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

    Jul 31, 2026Senyu Fei, Xiaopeng Yu, Siyin Wang +3World Model LearningVision-Language-Action Models

  4. Beacon: Knowing When and How to Perform Agentic Visual Reasoning

    Jul 30, 2026Qixun Wang, Yang Shi, Letian Cheng +11Tool Use in VLMsRL for VLMs

  5. Can Vision-Language Models Reason about AI Edits in Images?

    Jul 30, 2026Darsha Udayanga, Pin-Yu Chen, Payel Das +1Image Forgery DetectionImage Forgery Localization

  6. FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Self-Verification

    Jul 30, 2026Haoqing Wang, Xingrun Xing, Ziheng Li +2Tool Use in VLMsVLM Reasoning

  7. One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

    Jul 30, 2026Rui Tang, Wentao Yang, Peirong Zhang +4Visual TokenizationScene Text Recognition

  8. RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

    Jul 30, 2026Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou +4Image GenerationLarge Vision-Language Models

  9. RL2^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

    Jul 29, 2026Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer +4Vision-Language-Action ModelsTest-Time Adaptation of VLA Models

  10. ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning

    Jul 28, 2026Jiaqi Zhang, Tong Chen, Junliang Yu +2Group Relative Policy OptimizationAgentic Reasoning

  11. Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

    Jul 23, 2026Liqiang Jing, Xiong Zhou, Siddharth Varia +3VLM EvaluationVisual Reasoning

  12. MIRROR: Learning from the Other View for Multi-Modal Reasoning

    Jul 23, 2026Wen Ye, Yuxiao Qu, Aviral Kumar +1Cross-Modal Knowledge DistillationMultimodal Reasoning

  13. Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

    Jul 22, 2026Md Tanvirul AlamSynthetic Data GenerationVLM Reasoning

  14. DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

    Jul 21, 2026Thanni Adewuyi, Angelica Obayi, Andem Aniekan +10Radiology Report GenerationRadiology VLMs

  15. WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

    Jul 17, 2026Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence +4Open-Vocabulary Object DetectionWeed Detection

  16. Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

    Jul 16, 2026Harikrishnan P M, Goutham Vignesh, Ganesh Parab +4Multimodal GroundingEfficient Multimodal Inference

  17. SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

    Jul 15, 2026Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang +3Visual ReasoningSynthetic Data Generation

  18. SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

    Jul 15, 2026Cheng Tang, Junzhi Ning, Min Cen +9Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  19. Joint On-and-Off Policy Learning for Vision-and-Language Navigation

    Jul 15, 2026Qingrong He, Lin Zhao, Kevin Zheng +1Vision-Language NavigationInteractive Imitation Learning

  20. ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning

    Jul 14, 2026Zhao Yang, Yinan Shi, Mingyuan Yao +3Visuomotor Policy LearningVision-Language-Action Models

  21. ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

    Jul 14, 2026Yilun Kong, Yunpeng Qing, Guozheng Ma +4RL ExplorationRobotic Manipulation

  22. A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

    Jul 14, 2026Chengguang Gan, Zhixi Cai, Yunhao Liang +3Group Relative Policy OptimizationRL Fine-Tuning

  23. SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

    Jul 13, 2026Mingyuan Wu, Jingcheng Yang, Shengyi Qian +11Vision-Language ModelsMultimodal Reasoning

  24. REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation

    Jul 11, 2026Li Guo, Anas M. Tahir, Z. Jane WangRadiology Report GenerationRadiology VLMs

  25. Multimodal Reward Hacking in Reinforcement Learning

    Jul 10, 2026Jiayu Yao, Yiwei Wang, Anmeng Zhang +5Multimodal Large Language ModelsMultimodal Reward Modeling

  26. Learning from Hindsight for VLA Reinforcement Learning

    Jul 10, 2026Iris Xu, Sunshine Jiang, John Marangola +2Vision-Language-Action ModelsRL for VLMs