VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. Direct Product Flow Matching: Decoupling Radial and Angular Dynamics for Few-Shot Adaptation

    May 6, 2026Hongxu Chen, Yanghao Wang, Bowei Zhu +6Cross-Modal LearningFlow Matching

  2. DiCLIP: Diffusion Model Enhances CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation

    May 6, 2026Zhiwei Yang, Pengfei Song, Yucong Meng +3Vision-Language ModelsWeakly Supervised Image Segmentation

  3. Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection

    May 6, 2026Lihua Zhou, Mao Ye, Xiatian Zhu +7Open-Vocabulary Object DetectionTest-Time Adaptation

  4. From Priors to Perception: Grounding Video-LLMs in Physical Reality

    May 6, 2026Zicheng Zhao, Chaofan Gan, Shijie Li +1VLM AdaptationVLM Reasoning

  5. SpecPL: Disentangling Spectral Granularity for Prompt Learning

    May 6, 2026Jingtao Zhou, Xirui Kang, Feiyang Huang +1VLM AdaptationFrequency-Domain Feature Learning

  6. Joint Semantic Token Selection and Prompt Optimization for Interpretable Prompt Learning

    May 6, 2026Yating Wang, Yaqi Zhao, Yongshun Gong +2Prompt LearningVLM Adaptation

  7. StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning

    May 5, 2026Xiaowen Sun, Matthias Kerzel, Mengdi Li +3Physical ReasoningVLM Adaptation

  8. Memory-Efficient Continual Learning with CLIP Models

    May 5, 2026Ryan King, Gang Li, Bobak Mortazavi +1Class-Incremental LearningContrastive Learning

  9. The Detector Teaches Itself: Lightweight Self-Supervised Adaptation for Open-Vocabulary Object Detection

    May 5, 2026Yazhe Wan, Changjae OhOpen-Vocabulary Object DetectionVLM Adaptation

  10. Text-Guided Multi-Scale Frequency Representation Adaptation

    May 5, 2026Weicai Yan, Xinhua Ma, Wang Lin +1Domain AdaptationVLM Adaptation

  11. MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

    May 5, 2026Kangkang Wang, Qinting Jiang, Wanping Zhang +2VLM EvaluationVision-Language Models

  12. GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning

    May 5, 2026Yujun Li, Hongyuan Zhang, Yuan YuanVLM AdaptationTest-Time Adaptation of VLMs

  13. CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis

    May 5, 2026Abderrahmene Boudiaf, Sajd JavedOpen-Vocabulary Object DetectionAgricultural Image Analysis

  14. VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

    May 4, 2026Tanush Yadav, Mohammadreza Salehi, Jae Sung Park +6VLM EvaluationVLM Adaptation

  15. Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model

    May 4, 2026Zhou Bingtao, Xiang Mian, Ning QianSource-Free Domain AdaptationVLM Adaptation

  16. SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation

    Apr 30, 2026Pengna Li, Kangyi Wu, Shaoqing Xu +7VLM AdaptationVision-Language Navigation

  17. World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

    Apr 29, 2026Wanyue Zhang, Wenxiang Wu, Wang Xu +6Visual Spatial ReasoningVLM Adaptation

  18. Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

    Apr 29, 2026Hongjun Wang, Po Hu, Kai HanVLM AdaptationVision Foundation Model Adaptation

  19. Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

    Apr 28, 2026Tianshui Chen, Yujie Zhu, Jianman Lin +4Prompt LearningVLM Adaptation

  20. Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

    Apr 27, 2026Hai Wang, Xiaochen Yang, Mingzhi Dong +1VLM EvaluationVLM Adaptation

  21. Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

    Apr 27, 2026Lixian Chen, Yanhui Chen, Junyi LinVLM RobustnessTest-Time Adaptation

  22. M2M^2-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

    Apr 27, 2026Siyao Xiao, Yuhong Zhang, Zhifang Liu +9Language-Conditioned Robot ManipulationVLM Adaptation

  23. Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification

    Apr 27, 2026Xiaoliu Luo, Minxue Xiao, Ting Xie +5VLM AdaptationMulti-View Learning

  24. HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA

    Apr 26, 2026Francesco Dibitonto, Cigdem Beyan, Vittorio MurinoVisual Question AnsweringZero-Shot Learning

  25. Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection

    Apr 25, 2026Sanghoon Lee, Geon Lee, Hyekang Park +1Open-Vocabulary Object DetectionProbability Calibration

  26. EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges

    Apr 24, 2026Hyo Jin Jon, Longbin Jin, Eun Yi KimVLM AdaptationDomain Generalization

  27. Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

    Apr 24, 2026Gautam Kumar Jain, Carsten Markgraf, Julian StählerVisual Question AnsweringVLMs for Autonomous Driving