RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. video-SALMONN-R3^3: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

    Jun 23, 2026Yixuan Li, Guangzhi Sun, Yudong Yang +1Efficient VLM InferenceVideo QA

  2. E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

    Jun 22, 2026Sijing Li, Zhongwei Qiu, Zhuoya Wang +6Medical Image GroundingVLM Hallucination Mitigation

  3. AIR: Adaptive Interleaved Reasoning with Code in MLLMs

    Jun 22, 2026Cong Han, Xiaohan Lan, Haibo Qiu +1Multimodal Large Language ModelsMathematical Reasoning

  4. dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

    Jun 22, 2026Yuhao Wu, Yitian Liu, Weijie Shen +13Vision-Language-Action ModelsVLMs for Robotics

  5. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +1Visual Question AnsweringActive Perception

  6. VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

    Jun 22, 2026Haoling Li, Kai Zheng, Jie Wu +4Multimodal ReasoningMathematical Reasoning

  7. CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

    Jun 22, 2026Zhangyuan Yu, Wanran Sun, Guangjing Yang +2Multimodal ReasoningVLM Hallucination Mitigation

  8. CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

    Jun 18, 2026Chengwen Liu, Hao Peng, Jisheng Dang +3Reward ShapingVideo Reasoning

  9. Native Active Perception as Reasoning for Omni-Modal Understanding

    Jun 17, 2026Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8Audio-Visual UnderstandingActive Perception

  10. Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

    Jun 16, 2026Chengwen Liu, Zhe Huang, Jisheng Dang +3Multimodal Reward ModelingVideo Reasoning

  11. PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

    Jun 16, 2026Bochen Yang, Lianlei ShanEfficient VLA ModelsLatent Visual Reasoning

  12. See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

    Jun 16, 2026Yilian Liu, Sicong Leng, Guoshun Nan +7Multimodal PretrainingVisually Grounded Reasoning

  13. Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

    Jun 16, 2026Yatai Ji, An-Chieh Cheng, Yang Fu +13Visual Spatial Reasoning3D Spatial Reasoning

  14. Context-Aware RL for Agentic and Multimodal LLMs

    Jun 15, 2026Peiyang Xu, Bangzheng Li, Sijia Liu +4Multimodal GroundingContrastive RL

  15. Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

    Jun 15, 2026Tongyan Fang, Siyuan Huang, Naiyu Fang +6Credit Assignment in RLRobotic RL

  16. Thinking with Visual Grounding

    Jun 15, 2026Junkai Zhang, Yihe Deng, Kai-Wei Chang +1Visual Spatial ReasoningVision-Language Grounding

  17. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

    Jun 14, 2026Zebang Cheng, Shuimu Chen, Boxue Yang +7On-Policy Self-DistillationMultimodal Large Language Models

  18. Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

    Jun 13, 2026Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor +2Social Media AnalysisMultimodal Large Language Models

  19. DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

    Jun 13, 2026David Huang, Lianlei ShanEfficient Multimodal InferenceMultimodal Reasoning

  20. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  21. Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

    Jun 11, 2026Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai +2Multimodal ReasoningRL for Diffusion Models

  22. Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

    Jun 11, 2026Tingyu Li, Le Zhou, Siyuan Li +5Cross-Modal AlignmentMultimodal Reasoning

  23. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

    Jun 11, 2026Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning

  24. SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

    Jun 10, 2026Chao Lei, Yanbei Jiang, Markus Hiller +4Visual Spatial ReasoningReinforcement Learning with Verifiable Rewards