RL for VLMs

RL: Reinforcement Learning · VLM: Vision-Language Model

Latest papers 287

All topics
CardsList
  1. Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

    Mar 4, 2026Yuxuan Yang, Xiaotong Mao, Jingyao WangLLM AlignmentIndoor Scene Generation

  2. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

    Feb 27, 2026Yiyang Fang, Wenke Huang, Pei Fu +5Multimodal Large Language ModelsMultimodal Reasoning

  3. HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

    Feb 27, 2026Jiacheng Yang, Anqi Chen, Yunkai Dang +5Efficient Multimodal InferenceVLM Reasoning

  4. WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

    Feb 15, 2026Zhennan Jiang, Shangqing Zhou, Yutong Jiang +11World Models for RoboticsWorld Models

  5. LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation

    Feb 12, 2026Yue Hu, Avery Xi, Qixin Xiao +4Robot NavigationVision-Language Navigation

  6. CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

    Jan 12, 2026Chaoyu Li, Fei Tao, Pooyan FazliTest-Time Scaling for VLMsTest-Time Scaling

  7. Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

    Nov 18, 2025Zehao Liu, Weijieying Ren, Jipeng Zhang +4VLM RobustnessMedical Diagnosis

  8. SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

    Nov 10, 2025Hunar Batra, Haoqin Tu, Hardy Chen +3Visual Question AnsweringScene Graph Generation

  9. Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

    Oct 11, 2025Mingyang Lyu, Yinqian Sun, Erliang Lin +4Flow MatchingRobotic Manipulation

  10. Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

    Oct 2, 2025Derek Shi, Ruben Glatt, Christine Klymko +5Video-Language ModelsRL Fine-Tuning

  11. Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning

    Aug 22, 2025Ruiqi Wu, Yuang Yao, Na Su +11Medical Image AnalysisMultimodal Reasoning

  12. AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization

    Aug 6, 2025Jingyi Liao, Yongyi Su, Rong-Cheng Tu +6VLM AdaptationIndustrial Anomaly Detection

  13. Multimodal Mathematical Reasoning with Diverse Solving Perspective

    Jul 3, 2025Wenhao Shi, Zhiqiang Hu, Yi Bin +4Multimodal ReasoningMultimodal CoT Reasoning

  14. SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

    Date pendingHaolong Hu, Hanyu Li, Tiancheng He +6Language Model SteeringMultimodal Large Language Models

  15. ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

    Date pendingAnindya Mondal, Sauradip Nag, Anjan DuttaVLM AdaptationCrowd Counting

  16. VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models

    Date pendingChenyu Su, Zhaolong Shen, Yuan Qian +8Efficient VLA ModelsLaboratory Automation