RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. Imagine-RL: Residual-Confidence-Guided Cross-Attention for World-Model-Augmented VLA Reinforcement Learning

    Sep 21, 2026Kejia Hu, Wentong Zhai, Bo Zhao +1Robotic ManipulationVision-Language-Action Models

  2. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Efficient VLM InferenceLarge Vision-Language Models

  3. GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation

    Sep 16, 2026Kailing Li, Yu Han, Tianwen Qian +4Vision-Language NavigationVision-Language Grounding

  4. Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

    Sep 16, 2026Xinxin Song, Siyuan Li, Tingxiong Xiao +1Credit Assignment in RLExperience Replay

  5. Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models

    Sep 13, 2026Mingze Yin, Xiaohan Wang, Dian Li +8Multimodal Large Language ModelsMathematical Reasoning

  6. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Tool Use in VLMsMultimodal QA

  7. Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification

    Sep 7, 2026Yimeng Ye, Shuang Chen, Wenxuan Huang +8Reinforcement LearningRL Fine-Tuning

  8. Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning

    Sep 3, 2026Yijun Yang, Shenghe Zheng, Wenbo Li +8Visual Spatial Reasoning3D Spatial Reasoning

  9. Controllable Image Captioning with Prompt-Conditioned Scene Rewards

    Sep 1, 2026Jongyeop Hyun, Taeyoung Kim, Hyounghun KimImage CaptioningRL for VLMs

  10. Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

    Aug 20, 2026Haoqiang Kang, Yinpeng Chen, Luyang Liu +5Visual Spatial ReasoningMultimodal Reasoning

  11. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Group Relative Policy OptimizationStep-Level Credit Assignment in RL

  12. SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

    Aug 12, 2026Zile Zhou, Huining Yuan, Weichen Zhang +2Visual Spatial ReasoningProcess Reward Models

  13. CARE: Confidence-Aware Reasoning for Reliable Medical VQA

    Aug 11, 2026Yuetian Du, Yucheng Wang, Zhenyuan Chen +9Medical VQAMedical VLMs

  14. MIRA: Medical Image Reflection for Agentic Diagnosis

    Aug 11, 2026Shengzhi Wang, Jun Yang, Kai Wu +11Medical Image AnalysisLLM Agent Verification

  15. SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

    Aug 11, 2026Caoyuan Ma, Wenpu Liu, Weichu Xie +12VLM RobustnessAdversarial Attacks on VLMs

  16. FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

    Aug 10, 2026Guolei Huang, Tengfei She, Yuxuan Lu +3VLMs for Autonomous DrivingEnd-to-End Autonomous Driving

  17. CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

    Aug 10, 2026Jiaye Fu, Weiqi Li, Qiankun Gao +5Video Quality AssessmentRL for VLMs

  18. Evidence-RL: Towards Evidence-intensive Visual Reasoning

    Aug 8, 2026Haojie Huang, Xinlei Yu, Chengming Xu +6Vision-Language GroundingVisually Grounded Reasoning

  19. TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

    Aug 7, 2026Ziheng Liu, Quantao YangRobotic ManipulationVision-Language-Action Models

  20. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  21. Multi-Branch Policy Optimization for Multimodal Large Language Models

    Aug 5, 2026Shuai Lyu, Yuning Gong, Ruiling Gao +7Credit Assignment in RLMultimodal Large Language Models

  22. CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

    Aug 4, 2026Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel +8Radiology Report GenerationChest X-Ray Classification

  23. Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

    Aug 4, 2026Weichen Xu, Zhenhua Liu, Lin Luo +8Efficient VLA Model InferenceRobotic Manipulation

  24. CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding

    Aug 3, 2026Wei Jia, Zhicong Lu, Yu Chen +5Temporal Video GroundingVision-Language Alignment

  25. RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

    Aug 3, 2026Hongjie Zhou, Shiqin Wang, Haoyang Chen +5Video-Language Model EvaluationRemote Sensing

  26. Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

    Aug 2, 2026Jianmin Chen, Jiaqi Tang, Wei Wei +9Vision-Language ModelsLong-Context Modeling