RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. VideoEvolve: Co-Evolving Memory and Retrieval for Long Video Understanding

    Oct 7, 2026Yongchao Xu, Bowen Ye, Jiefeng Gan +5Long-Video UnderstandingMemory-Augmented Video Understanding

  2. Selective Transfer of RL Updates for Visual Reasoning

    Oct 6, 2026Suxin Ji, Hungtao Wan, Mingjun Liu +1Reinforcement LearningVLM Reasoning

  3. MeSD: Multi-Evidence Self-Distillation for VideoLLM

    Oct 5, 2026Weijie Zhu, Han Fang, Hanyu Fu +13On-Policy Self-DistillationVideo-Language Models

  4. Controllable Multi-label Video Safety Detection via Adaptive Tversky Policy Optimization

    Oct 1, 2026Guangyu Yang, Jingbiao Mei, Mingsheng Sun +5Video Content ModerationRL for VLMs

  5. Same Reward, Different Skills: When Multimodal RL Learns to Look

    Oct 1, 2026Haocun Ye, Xinlong Jiang, Qile Chen +6Reinforcement Learning with Verifiable RewardsVisual Grounding

  6. eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

    Oct 1, 2026Dehao Huang, Jianbang Liu, Jianpan Gao +7Efficient VLA ModelsRobotic Manipulation

  7. EviRover: Reinforcing Agentic Perception Beyond a Glance

    Sep 30, 2026Kaixuan Fan, Kaituo Feng, Tianshuo Peng +4Tool-Using Vision-Language AgentsActive Visual Perception

  8. Aligning Thoughts with Answers: Probability Rewards to Tame Thinking Drift

    Sep 30, 2026Pengzhan Sun, Shiu-hong Kao, Shijie Li +4VLM ReasoningRL for VLMs

  9. Beyond Prediction: Steering VLM Agents with Retrospective World Modeling

    Sep 30, 2026Yongjiang Liu, Jie Zhang, Haoyue Zhang +3World Model LearningWorld Models

  10. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Visual Spatial ReasoningLarge Vision-Language Models

  11. MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary

    Sep 29, 2026Shengyun Zhong, Xinkang Zhao, Ziyuan Chu +1Reinforcement LearningVideo-Language Models

  12. MG-Thinker: Bi-Axial Self-Reflection for Multi-Image Reasoning Grounding

    Sep 29, 2026Heyu Huang, Chi Chen, Zonghao Guo +3Multimodal GroundingMultimodal CoT Reasoning

  13. Seek Before You Move: Evidence Seeking for Progress Grounding in Vision-Language Navigation

    Sep 29, 2026Zhimin Wang, Meiyuan Zhu, Duo Wu +8Vision-Language NavigationRL for VLMs

  14. HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent

    Sep 29, 2026Zhangquan Chen, Yaoxin Niu, Xiang An +5Human-in-the-Loop AnnotationProcess Supervision

  15. Learn from the Gap: Differential-Aware Advantage Pruning with Adaptive Rollout Sampling for GRPO

    Sep 29, 2026Jiahua Yang, Zhiwei Yang, Xianpeng Zhang +7Group Relative Policy OptimizationRL for VLMs

  16. Momentum-Coupled Rubric Adaptation for Detailed Image Captioning

    Sep 29, 2026Zhenwen Ji, Lei Jin, Shanyong Wang +6Image CaptioningRubric-Based RL

  17. DSPO: Diversity-aware Subjective Policy Optimization for Robust Emotional Reasoning

    Sep 29, 2026Cheng Ye, Weidong Chen, Bingyan Xu +1VLM RobustnessMultimodal Reasoning

  18. PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents

    Sep 28, 2026Jiazhou Zhou, Hu Zhou, Yucheng Chen +3On-Policy Self-DistillationReinforcement Learning with Verifiable Rewards

  19. Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models

    Sep 28, 2026Xingming Long, Jie Zhang, Yuecong Min +2Credit Assignment in RLStep-Level Credit Assignment in RL

  20. Adjoint Guidance Flow: Amortized Critic Guidance for VLA Policies

    Sep 28, 2026Jeongsol Kim, Youngjun Jun, Kyumin Choi +6Efficient VLA ModelsVision-Language-Action Models

  21. The Low-Rank Structure of VLA Reinforcement Learning

    Sep 28, 2026Minjae Oh, Yoonah Park, Jongwon Lim +1Vision-Language-Action ModelsRL Post-Training

  22. Reinforcement Learning from Intermediate Renders for Image-to-Code Generation

    Sep 28, 2026Omri Kaduri, Kate Feingold, Phillip Isola +1RL for Code GenerationCode Generation

  23. Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

    Sep 28, 2026Xi Xiao, Tianchen Zhao, Youngeun Kim +10Large Vision-Language ModelsLatent Visual Reasoning

  24. TTRSD: Test-Time Reinforcement Learning with Self-Distillation for Vision-Language Models

    Sep 27, 2026Shuning Wang, Zhiheng Wu, Xun Zhou +8Test-Time Adaptation of VLMsVLM Distillation

  25. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

    Sep 23, 2026Yingxuan Zhuang, Miao Pan, Wangjie Gan +6Multimodal Large Language ModelsVLM Hallucination Mitigation

  26. Video-HopChain: Multi-Hop Questions and Confidence-Gated Exploration for Video Reasoning Models

    Sep 22, 2026Trung Nguyen Quang, Yuhao Dong, Shuo Sun +4Group Relative Policy OptimizationVideo Reasoning