RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

    Jun 22, 2026Haoling Li, Kai Zheng, Jie Wu +4Multimodal ReasoningMathematical Reasoning

  2. CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

    Jun 22, 2026Zhangyuan Yu, Wanran Sun, Guangjing Yang +2Multimodal ReasoningVLM Hallucination Mitigation

  3. CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

    Jun 18, 2026Chengwen Liu, Hao Peng, Jisheng Dang +3Reward ShapingVideo Reasoning

  4. Native Active Perception as Reasoning for Omni-Modal Understanding

    Jun 17, 2026Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8Audio-Visual UnderstandingActive Perception

  5. Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

    Jun 16, 2026Chengwen Liu, Zhe Huang, Jisheng Dang +3Multimodal Reward ModelingVideo Reasoning

  6. PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

    Jun 16, 2026Bochen Yang, Lianlei ShanEfficient VLA ModelsLatent Visual Reasoning

  7. See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

    Jun 16, 2026Yilian Liu, Sicong Leng, Guoshun Nan +7Multimodal PretrainingVisually Grounded Reasoning

  8. Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

    Jun 16, 2026Yatai Ji, An-Chieh Cheng, Yang Fu +13Visual Spatial Reasoning3D Spatial Reasoning

  9. Context-Aware RL for Agentic and Multimodal LLMs

    Jun 15, 2026Peiyang Xu, Bangzheng Li, Sijia Liu +4Multimodal GroundingContrastive RL

  10. Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

    Jun 15, 2026Tongyan Fang, Siyuan Huang, Naiyu Fang +6Credit Assignment in RLRobotic RL

  11. Thinking with Visual Grounding

    Jun 15, 2026Junkai Zhang, Yihe Deng, Kai-Wei Chang +1Visual Spatial ReasoningVision-Language Grounding

  12. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

    Jun 14, 2026Zebang Cheng, Shuimu Chen, Boxue Yang +7On-Policy Self-DistillationMultimodal Large Language Models

  13. Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

    Jun 13, 2026Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor +2Social Media AnalysisMultimodal Large Language Models

  14. DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

    Jun 13, 2026David Huang, Lianlei ShanEfficient Multimodal InferenceMultimodal Reasoning

  15. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  16. Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

    Jun 11, 2026Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai +2Multimodal ReasoningRL for Diffusion Models

  17. Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

    Jun 11, 2026Tingyu Li, Le Zhou, Siyuan Li +5Cross-Modal AlignmentMultimodal Reasoning

  18. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

    Jun 11, 2026Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning

  19. SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

    Jun 10, 2026Chao Lei, Yanbei Jiang, Markus Hiller +4Visual Spatial ReasoningReinforcement Learning with Verifiable Rewards

  20. Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

    Jun 9, 2026Yifu Yuan, Yaoting Huang, Xianze Yao +20Long-Horizon Robotic ManipulationRobot Foundation Models

  21. CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

    Jun 8, 2026Penghui Yang, Long Xing, Xiaoyi Dong +10Image CaptioningMultimodal Pretraining

  22. Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +4Object Hallucination in VLMsMulti-Agent Collaboration

  23. Temporal-Aware Reasoning Optimization for Video Temporal Grounding

    Jun 8, 2026Minghang Zheng, Zihao Yin, Yi Yang +2Temporal Video GroundingTemporal Reasoning