RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

    May 27, 2026Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang +13Image CaptioningObject Hallucination in VLMs

  2. ABot-OCR Technical Report

    May 27, 2026Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng +3Vision-Language ModelsDocument Parsing

  3. Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Peijie Qiu +11Visual Question AnsweringTool-Using Vision-Language Agents

  4. Touch-R1: Reinforcing Touch Reasoning in MLLMs

    May 26, 2026Yingxin Lai, Yafei Zhou, Fucai Zhu +2Tactile SensingMultimodal Large Language Models

  5. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

    May 26, 2026Zhiwei Ning, Wenwen Tong, Xiangli Kong +12Multimodal ReasoningVLM Reasoning

  6. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  7. DUEL: Adversarial Self-Play for Multimodal Reasoning

    May 24, 2026Lin Qiu, Hanqing Zeng, Yao Liu +3VLM RobustnessVLM Reasoning

  8. B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

    May 22, 2026Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi +2Image SegmentationReinforcement Learning

  9. Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

    May 21, 2026Changyuan Tian, Zhicong Lu, Huaxing Liu +7Multimodal Large Language ModelsMultimodal Reasoning

  10. Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

    May 21, 2026Dazhao Du, Jian Liu, Jialong Qin +7Counterfactual EvaluationVideo-Language Models

  11. EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models

    May 21, 2026Shiqi Huang, Ziyue Wang, Zhongrong Zuo +3Vision-Language ModelsVideo Reasoning

  12. Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming

    May 20, 2026Yue Zhou, Erxuan Wu, Yikang Sun +5Visual Question AnsweringUncertainty Estimation for VLA Models

  13. IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

    May 20, 2026Rongbin Tan, Fangfang Lin, Zhenlong Yuan +10Industrial Anomaly DetectionTool-Using Vision-Language Agents

  14. PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models

    May 19, 2026Peizheng Guo, Jingyao Wang, Changwen Zheng +1Robot Policy LearningCredit Assignment in RL

  15. ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison

    May 19, 2026Tianle Li, Xuyang Shen, Yan Ma +7VLM EvaluationReward Modeling

  16. Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis

    May 19, 2026Tianwei Lin, Zhongwei Qiu, Jie Cao +7Radiology Report GenerationRadiology VLMs

  17. Leveraging Latent Visual Reasoning in Silence

    May 18, 2026Dongyao Zhu, Zhen Wang, Xi Xiao +7Visual Spatial ReasoningLatent Visual Reasoning

  18. Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

    May 18, 2026Junming Liu, Yuqi Li, Yifei Sun +6VLM RobustnessVision-Language Models

  19. IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

    May 18, 2026Chenghao Li, Fusheng Hao, Xikai Zhang +5Multimodal GroundingObject Hallucination in VLMs

  20. AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

    May 18, 2026Pan Wang, Yihao Hu, Xiujin Liu +3Memory-Augmented VLMsReward Shaping

  21. An Efficient Streaming Video Understanding Framework with Agentic Control

    May 18, 2026Jinming Liu, Jianguo Huang, Zhaoyang Jia +7Streaming Video UnderstandingAdaptive Model Routing

  22. GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

    May 18, 2026Xiongbin Wu, Zhihao Luo, Shanzhe Lei +7Reinforcement LearningGroup Relative Policy Optimization

  23. Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

    May 16, 2026Peng Cui, Boyao Yang, Jun ZhuMultimodal RobustnessVLM Reasoning

  24. OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

    May 16, 2026Jinjie Shen, Zheng Huang, Yuchen Zhang +7Tool Use in VLMsImage Forgery Detection

  25. Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

    May 15, 2026Vaidehi Bagaria, Nikshep Grampurohit, Pulkit VermaReinforcement LearningNeural Network Optimization

  26. WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

    May 15, 2026Baining Zhao, Jiacheng Xu, Weicheng Feng +13World Model LearningVision-Language Navigation