RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

    Jun 9, 2026Yifu Yuan, Yaoting Huang, Xianze Yao +20Long-Horizon Robotic ManipulationRobot Foundation Models

  2. CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

    Jun 8, 2026Penghui Yang, Long Xing, Xiaoyi Dong +10Image CaptioningMultimodal Pretraining

  3. Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +4Object Hallucination in VLMsMulti-Agent Collaboration

  4. Temporal-Aware Reasoning Optimization for Video Temporal Grounding

    Jun 8, 2026Minghang Zheng, Zihao Yin, Yi Yang +2Temporal Video GroundingTemporal Reasoning

  5. Scaling by Diversified Experience for Vision-Language-Action Models

    Jun 8, 2026Leiyu Wang, Zhaofengnian Wang, Xueqi Li +3VLM RobustnessVision-Language-Action Models

  6. PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping

    Jun 7, 2026Qiming Li, Tianlun Li, Xiaolong Cheng +5Token-Level Credit AssignmentVLM Reasoning

  7. DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

    Jun 6, 2026Hangui Lin, Yan Shu, Zhengyang Liang +8Cross-Modal AlignmentVLM Reasoning

  8. Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

    Jun 5, 2026Shizhe Xiang, Ke An, Wenlong Yu +4Large Vision-Language ModelsMultimodal Reasoning

  9. VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation

    Jun 5, 2026Ming Dai, Sen Yang, Boqiang Duan +4Video Object SegmentationReferring Video Object Segmentation

  10. Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

    Jun 4, 2026Chenming Zhu, Jingli Lin, Yilin Long +4Visual Spatial ReasoningWorld Model Learning

  11. Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

    Jun 4, 2026Tianxiang Jiang, Linquan Wu, Sheng Xia +5Large Vision-Language ModelsLatent Visual Reasoning

  12. AsyncWebRL: Efficient Multi-Step RL for Visual Web Agents

    Jun 4, 2026Hao Bai, Rui Yang, Chenlu Ye +3Asynchronous RLReinforcement Learning

  13. Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection

    Jun 2, 2026Senjie Jin, Peixin Wang, Boyang Liu +8Token-Level Credit AssignmentVisual Reasoning

  14. Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

    Jun 2, 2026Hao Zhong, Muzhi Zhu, Shenyan Zeng +8VLM EvaluationSpatial Reasoning Benchmarks

  15. Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models

    Jun 1, 2026Wei Deng, Xianlin Zhang, Mengshi QiActive PerceptionVisual Spatial Reasoning

  16. DeepLatent: Think with Images via Parallel Latent Visual Reasoning

    May 30, 2026Dongchen Lu, Zhimo Li, Mao Shu +1Latent Visual ReasoningVLM Reasoning

  17. SDR: Set-Distance Rewards for Radiology Report Generation

    May 30, 2026Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge +1Radiology Report GenerationTest-Time Scaling

  18. MindZero: Learning Online Mental Reasoning With Zero Annotations

    May 29, 2026Shunchi Zhang, Jin Lu, Chuanyang Jin +3Self-Supervised LearningTheory of Mind

  19. iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

    May 29, 2026Chang-Bin Zhang, Yujie Zhong, Qiang Zhang +1Large Vision-Language ModelsVision-Language Grounding

  20. Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

    May 29, 2026Ruina Hu, Chen Wang, Lai Wei +5Reinforcement Learning with Verifiable RewardsVisually Grounded Reasoning

  21. Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

    May 29, 2026Junyang Shu, Zhiwei Lin, Bingqing Wei +1Reward ShapingValue Function Estimation

  22. CFCamo: A Counterfactual Detect-or-Abstain Framework for Camouflaged Object Detection

    May 28, 2026Suhang Li, Osamu Yoshie, Yuya IeiriSelective PredictionObject Hallucination in VLMs

  23. Reinforcement Learning with Robust Rubric Rewards

    May 28, 2026Ya-Qi Yu, Hao Wang, Fangyu Hong +15Reinforcement LearningRubric-Based RL

  24. AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

    May 28, 2026Yilun Qiu, Jiahe Wang, Cilin Yan +4Video ReasoningMultimodal Agents

  25. Planning with the Views

    May 28, 2026Kangrui Wang, Linjie Li, Zhengyuan Yang +7Next-Best-View PlanningRL for VLMs