RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

    May 13, 2026Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong +6VLM ReasoningReinforcement Learning with Verifiable Rewards

  2. GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

    May 13, 2026Mingzhe Huang, Weijun Wang, Xin Ding +7Efficient VLM InferenceVisual Token Pruning

  3. Reinforcing VLAs in Task-Agnostic World Models

    May 12, 2026Yucen Wang, Rui Yu, Fengming Zhang +5World Model LearningWorld Models

  4. Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

    May 10, 2026Xuan Gong, Hanbo Huang, Hao Zheng +4Vision-Language ModelsVision-Language Grounding

  5. Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

    May 10, 2026Jiafeng Liang, Zhihao Zhu, Zihan Zhang +7Causal DiscoveryMultimodal Large Language Models

  6. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  7. SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

    May 10, 2026Kun Xiang, Terry Jingchen Zhang, Zirong Liu +15Cross-Modal LearningMultimodal Grounding

  8. Reinforcing Multimodal Reasoning Against Visual Degradation

    May 10, 2026Rui Liu, Dian Yu, Haolin Liu +6VLM RobustnessImage Corruption Robustness

  9. RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

    May 8, 2026Junwei Wen, Deshui Miao, Guangming Lu +2Video Object SegmentationVideo Reasoning

  10. Structured Role-Aware Policy Optimization for Multimodal Reasoning

    May 8, 2026Bingqing Jiang, Difan ZouToken-Level Credit AssignmentMultimodal Reasoning

  11. Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning

    May 7, 2026Xueheng Li, Yu Wang, Tao Hu +6Agricultural Image AnalysisVLM Reasoning

  12. VISD: Enhancing Video Reasoning via Structured Self-Distillation

    May 7, 2026Hao Lin, Kunyang Lv, Xu Jiang +5Video-Language ModelsVideo Reasoning

  13. Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

    May 6, 2026Miao Wang, Yuling Shi, Yijiang Li +8Grounded Text GenerationLarge Language Model-Based Role-Play Simulation

  14. What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity

    May 5, 2026Haoxi Li, Qinglin Hou, Jianfei Ma +6Intrinsic MotivationRL Exploration

  15. Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

    May 5, 2026Shule Lu, Yujing Wang, Hainan Zhang +5Reward ModelingPreference Optimization

  16. GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning

    May 5, 2026Yujun Li, Hongyuan Zhang, Yuan YuanVLM AdaptationTest-Time Adaptation of VLMs

  17. Perceptual Flow Network for Visually Grounded Reasoning

    May 4, 2026Yangfu Li, Yuning Gong, Hongjian Zhan +8Object Hallucination in VLMsVLM Reasoning

  18. Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts

    May 3, 2026Hongkun Pan, Yuwei Wu, Wanyi Hong +8Data VisualizationMultimodal CoT Reasoning

  19. MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

    May 2, 2026Yin Zhang, Jiaxuan Zhao, Zonghan Wu +5Vision-Language ModelsReinforcement Learning

  20. Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

    May 1, 2026Chengshuai Shi, Wenzhe Li, Xinran Liang +10Sequential Decision MakingProximal Policy Optimization

  21. LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning

    Apr 30, 2026Hao Chen, Jiaming Liu, Zhonghao Yan +10RL for RoboticsRobot Foundation Models

  22. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal Large Language ModelsMultimodal Reasoning

  23. WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning

    Apr 30, 2026Ke Xu, Zhongyuan LianVLM EvaluationVisual Question Answering

  24. Improving Vision-language Models with Perception-centric Process Reward Models

    Apr 27, 2026Yingqian Min, Kun Zhou, Yifan Li +6Process Reward ModelsObject Hallucination in VLMs

  25. See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

    Apr 27, 2026Zhiheng Wu, Tong Wang, Shuning Wang +2Tool Use in VLMsVLM Reasoning

  26. Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

    Apr 27, 2026Zhicheng Zhang, Wentao Gu, Weicheng Wang +5Audio-Visual UnderstandingTree Search