VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval

    Aug 6, 2026Xi Chen, Xu Chen, Xiangyang Jia +3VLM AdaptationImage-Text Retrieval

  2. Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models

    Aug 6, 2026Jingyan Jiang, Yaru Sun, Xiao Chen +5VLM AdaptationTest-Time Adaptation of VLMs

  3. SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

    Aug 6, 2026Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan +1VLM AdaptationMultimodal Pretraining

  4. On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing

    Aug 5, 2026Simon Lösche, Barış Büyüktaş, Mathis Adler +3Remote Sensing Image UnderstandingPrompt Learning

  5. COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation

    Aug 5, 2026Bo Li, Junjie Peng, Xiaohua Xie +1Source-Free Domain AdaptationVLM Adaptation

  6. MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

    Aug 4, 2026Gengyuan Liu, Nanzhou Wang, Chang Liu +5Vision-Language ModelsVLM Adaptation

  7. SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

    Aug 4, 2026Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu +1VLM AdaptationCross-Modal Retrieval

  8. In-Context Collapse in Vision-Language Models and How to Mitigate it?

    Aug 3, 2026Mohammad RostamiVLM RobustnessVision-Language Models

  9. Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

    Aug 3, 2026Yan Huang, Guowei Wang, Xu Wang +2VLM RobustnessTest-Time Adaptation

  10. HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

    Aug 3, 2026Jin Cui, Chuanchang Su, Jiayi Lu +3Visual Question AnsweringVLM Robustness

  11. Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

    Aug 3, 2026Tianyu Liang, Xiangxi Zheng, Yilin Wang +1VLM AdaptationMultimodal Token Compression

  12. Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

    Aug 2, 2026Nafis Fuad, Xiaodong Qian, Dongxiao ZhuVLM AdaptationDepth Estimation

  13. PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

    Aug 2, 2026Yicheng Xiao, Haoxuan Ma, Caorui Li +7Self-Supervised LearningVLM Adaptation

  14. VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection

    Jul 31, 2026Peng Chen, Kaige Li, Wei Wang +5VLM AdaptationFrequency-Domain Feature Learning

  15. Visual Distribution Anchoring for Efficient Prompt Tuning

    Jul 31, 2026Pouya Parsa, Raoof Zare Moayedi, Seongjin ChoiSource-Free Domain AdaptationDomain Adaptation

  16. Anatomy Contextualized Adaption of CT Foundation Models

    Jul 29, 2026Roshan Kenia, Stephanie L McNamara, William LotterMedical Imaging Foundation ModelsVLM Adaptation

  17. Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

    Jul 29, 2026Mingkuan Feng, Zhengqi Wen, Jianhua TaoVLM AdaptationLarge Vision-Language Models

  18. Rethinking Expert Training for Model Merging with Prompt Learning

    Jul 27, 2026Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno +3VLM AdaptationMulti-Task Learning

  19. IJCB-AFMFR 2026: Competition on Adapting Foundation Models for Face Recognition Using Synthetic Training Data

    Jul 27, 2026Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira +13VLM AdaptationVision Foundation Model Adaptation

  20. Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization

    Jul 27, 2026Haoyue Liu, Xiaoyu Ma, Ye Chen +2Visual Question AnsweringVLM Adaptation

  21. The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

    Jul 25, 2026Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler +2VLM AdaptationVisual Reasoning

  22. What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

    Jul 25, 2026Chen-Yi Lu, Yueh-Shao Chen, Somali ChaterjiVision-Language ModelsVLM Adaptation

  23. Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

    Jul 25, 2026Shuai Wang, Daoan Zhang, Zhe Tang +2VLM AdaptationOn-Policy Self-Distillation

  24. Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

    Jul 24, 2026Yuheng Zong, Minghua Wang, Xin Zhao +3Remote Sensing Image UnderstandingFine-Tuning

  25. Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

    Jul 23, 2026Yuhua Wang, Xiaodong Li, Yihao Guo +6VLM AdaptationDifferentially Private Federated Learning

  26. DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

    Jul 23, 2026Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh +1VLM AdaptationOpen-Vocabulary Semantic Segmentation

  27. Test-Time Training for Modality Order Consistency in Vision-Language Models

    Jul 22, 2026Aditi Gupta, Yossi GandelsmanVLM RobustnessVLM Adaptation