RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  2. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  3. DUEL: Adversarial Self-Play for Multimodal Reasoning

    May 24, 2026Lin Qiu, Hanqing Zeng, Yao Liu +3VLM RobustnessVLM Reasoning

  4. B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

    May 22, 2026Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi +2Image SegmentationReinforcement Learning

  5. Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

    May 21, 2026Changyuan Tian, Zhicong Lu, Huaxing Liu +7Multimodal Large Language ModelsMultimodal Reasoning

  6. Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

    May 21, 2026Dazhao Du, Jian Liu, Jialong Qin +7Counterfactual EvaluationVideo-Language Models

  7. EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models

    May 21, 2026Shiqi Huang, Ziyue Wang, Zhongrong Zuo +3Vision-Language ModelsVideo Reasoning

  8. Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming

    May 20, 2026Yue Zhou, Erxuan Wu, Yikang Sun +5Visual Question AnsweringUncertainty Estimation for VLA Models

  9. IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

    May 20, 2026Rongbin Tan, Fangfang Lin, Zhenlong Yuan +10Industrial Anomaly DetectionTool-Using Vision-Language Agents

  10. PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models

    May 19, 2026Peizheng Guo, Jingyao Wang, Changwen Zheng +1Robot Policy LearningCredit Assignment in RL

  11. ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison

    May 19, 2026Tianle Li, Xuyang Shen, Yan Ma +7VLM EvaluationReward Modeling

  12. Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis

    May 19, 2026Tianwei Lin, Zhongwei Qiu, Jie Cao +7Radiology Report GenerationRadiology VLMs

  13. Leveraging Latent Visual Reasoning in Silence

    May 18, 2026Dongyao Zhu, Zhen Wang, Xi Xiao +7Visual Spatial ReasoningLatent Visual Reasoning

  14. Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

    May 18, 2026Junming Liu, Yuqi Li, Yifei Sun +6VLM RobustnessVision-Language Models

  15. IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

    May 18, 2026Chenghao Li, Fusheng Hao, Xikai Zhang +5Multimodal GroundingObject Hallucination in VLMs

  16. AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

    May 18, 2026Pan Wang, Yihao Hu, Xiujin Liu +3Memory-Augmented VLMsReward Shaping

  17. An Efficient Streaming Video Understanding Framework with Agentic Control

    May 18, 2026Jinming Liu, Jianguo Huang, Zhaoyang Jia +7Streaming Video UnderstandingAdaptive Model Routing

  18. GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

    May 18, 2026Xiongbin Wu, Zhihao Luo, Shanzhe Lei +7Reinforcement LearningGroup Relative Policy Optimization

  19. Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

    May 16, 2026Peng Cui, Boyao Yang, Jun ZhuMultimodal RobustnessVLM Reasoning

  20. OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

    May 16, 2026Jinjie Shen, Zheng Huang, Yuchen Zhang +7Tool Use in VLMsImage Forgery Detection

  21. Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

    May 15, 2026Vaidehi Bagaria, Nikshep Grampurohit, Pulkit VermaReinforcement LearningNeural Network Optimization

  22. WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

    May 15, 2026Baining Zhao, Jiacheng Xu, Weicheng Feng +13World Model LearningVision-Language Navigation

  23. From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

    May 15, 2026Yuyuan Liu, Yiping Ji, Anjie Le +6Vision-Language GroundingVisual Grounding

  24. REC-RL: Referring expression counting via Gaussian and range-based reward optimization

    May 15, 2026Hui Liu, Yunlai Teng, Kunlong Bai +4VLM ReasoningRL for VLMs

  25. ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

    May 14, 2026Ziyu Guo, Rain Liu, Xinyan Chen +1Visual ReasoningLarge Vision-Language Models

  26. EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

    May 14, 2026Yuejiao Su, Xinshen Zhang, Zhen Ye +3Egocentric Video UnderstandingVision-Language Grounding

  27. Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

    May 13, 2026Haozhe Wang, Qixin Xu, Changpeng Wang +4Multimodal ReasoningVLM Reasoning

  28. CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

    May 13, 2026Tengda Guo, Jie Leng, Hanlei Li +6Process Reward ModelsVisual Reasoning