RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

    Jul 7, 2026Han-Jun Ko, Jr-Jen Chen, Haobo Yuan +4Physical ReasoningVLM Reasoning

  2. Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

    Jul 7, 2026Zhiwei Yang, Yuanchen Wu, Nan Zhang +3Multimodal Large Language ModelsMultimodal CoT Reasoning

  3. TimeThink: Reasoning with Time for Video LLMs

    Jul 6, 2026Handong Li, Longteng Guo, Zikang Liu +8Temporal Video GroundingProcess Reward Models

  4. CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

    Jul 5, 2026Zhaohong Liu, Hao Ye, Xianlin Zhang +1VLMs for Autonomous DrivingEfficient VLM Inference

  5. Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

    Jul 4, 2026Zican Hu, Xuyang Hu, Yiming Liu +10Unified Multimodal ModelsMultimodal Reasoning

  6. Incentivizing Vision Language Models to Search for Long Video Question Answering

    Jul 3, 2026Harsh Goel, S P Sharan, Sahil Shah +4Tool Use in VLMsLong-Video QA

  7. VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

    Jul 3, 2026Zhenkun Gao, Yicheng Bao, Jinlong Peng +13Multimodal RAGVideo QA

  8. Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

    Jul 2, 2026Liyan Tang, Fangcong Yin, Greg DurrettVLM RobustnessVision-Language Models

  9. Guided Action Flow: Value-Guided Sampling for Frozen Vision-Language-Action Policies

    Jul 2, 2026Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng +8Robotic ManipulationVision-Language-Action Models

  10. Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

    Jul 1, 2026Hongxing Li, Xiufeng Huang, Dingming Li +11Visual ReasoningVLM Reasoning

  11. Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

    Jun 30, 2026Junha Jung, Minbyul Jeong, Suhyeon Lim +5Process Reward ModelsMedical VQA

  12. Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

    Jun 30, 2026Kaitao Chen, Weiqian Zhao, Jiamin Wu +6Efficient Multimodal InferenceMedical VQA

  13. H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

    Jun 29, 2026Eric Peh, Debaditya Roy, Basura FernandoReinforcement LearningVisual Reasoning

  14. StrucTab: A Structured Optimization Framework for Table Parsing

    Jun 29, 2026Gengluo Li, Shangpin Peng, Chengquan Zhang +10Table Structure RecognitionVLM Reasoning

  15. Personalizing MLLMs via Reinforced Multimodal Reference Game

    Jun 27, 2026Deepayan Das, Davide Talon, Yiming Wang +2Multimodal Large Language ModelsPersonalized Language Models

  16. Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

    Jun 26, 2026Shuimu Chen, Yuteng Chen, Yuanshen Guan +7LLM Self-CorrectionLong-Video Understanding

  17. LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

    Jun 26, 2026Nicolas Baumann, Liam Boyle, Pu Deng +5Efficient VLM InferenceVLM Distillation

  18. Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

    Jun 24, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +6Multimodal ReasoningMultimodal Hallucination

  19. video-SALMONN-R3^3: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

    Jun 23, 2026Yixuan Li, Guangzhi Sun, Yudong Yang +1Efficient VLM InferenceVideo QA

  20. E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

    Jun 22, 2026Sijing Li, Zhongwei Qiu, Zhuoya Wang +6Medical Image GroundingVLM Hallucination Mitigation

  21. AIR: Adaptive Interleaved Reasoning with Code in MLLMs

    Jun 22, 2026Cong Han, Xiaohan Lan, Haibo Qiu +1Multimodal Large Language ModelsMathematical Reasoning

  22. dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

    Jun 22, 2026Yuhao Wu, Yitian Liu, Weijie Shen +13Vision-Language-Action ModelsVLMs for Robotics

  23. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +1Visual Question AnsweringActive Perception