VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. Open-Vocabulary Gaze Object Prediction: Benchmark and Method

    Jul 21, 2026Binglu Wang, Sensen Niu, Ying Chen +1VLM Adaptation

  2. Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

    Jul 21, 2026Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham +1VLM AdaptationMultimodal Embedding

  3. PRiSM: Prototype Regularization for Few-Shot VLMs

    Jul 20, 2026Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz +1VLM AdaptationPrototype Learning

  4. PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

    Jul 20, 2026Li Xian, Mingxi Li, Yizheng Wang +3VLM AdaptationMultimodal Large Language Models

  5. Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

    Jul 20, 2026Lingrui Li, Nan Pu, Dong Zhao +4Memory-Augmented VLMsVLM Adaptation

  6. DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation

    Jul 20, 2026Siobhan Reid, Zhixiang Chi, Li Gu +3Test-Time AdaptationFew-Shot Domain Adaptation

  7. Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs

    Jul 18, 2026Raza Imam, Darakshan Rashid, Yutong Xie +3VLM RobustnessVLM Adaptation

  8. Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction

    Jul 17, 2026Jiazhen Huang, Zhiming Liu, Changhu Wang +3Class-Imbalanced LearningTest-Time Adaptation

  9. U-shaped Multi-granularity Learning for Vision-Language Models

    Jul 16, 2026Biao Chen, Yunqian Yu, Xiangxu Zhao +3VLM AdaptationVisual Prompt Learning

  10. Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

    Jul 16, 2026Yufeng Ji, Wenhao Tang, Haoyi Niu +3VLM AdaptationVision-Language-Action Models

  11. Fine-grained CLIP fine-tuning with self-annotated region alignment

    Jul 15, 2026Chenyang Zhao, Wei Lin, Antoni B. Chan +1VLM AdaptationVision-Language Grounding

  12. MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

    Jul 14, 2026Yumiao Zhao, Bo Jiang, Min Lu +2VLM AdaptationQuantum Machine Learning

  13. PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs

    Jul 13, 2026Jing Liu, Kun Yang, Yan Wang +5Multimodal Federated LearningFederated Learning Aggregation

  14. MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

    Jul 13, 2026Zheng Zeng, Deepak Sridhar, Nuno VasconcelosVLM RobustnessVLM Adaptation

  15. Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

    Jul 12, 2026Hao Zheng, Jinyi Huang, Tiantian Zheng +2VLM AdaptationVideo Action Recognition

  16. Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

    Jul 11, 2026Shihao Yuan, Yuanze Li, Ruyi Zhang +2VLM AdaptationMultimodal Large Language Models

  17. TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models

    Jul 10, 2026Tianyou Jiang, Ziyu ZhouFew-Shot Domain AdaptationVLM Adaptation

  18. Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

    Jul 10, 2026Yungeng Liu, Xuanzi Fang, Haijin Zeng +2VLM AdaptationText-Guided Image Segmentation

  19. Robustifying Vision-Language Models via Test-Time Prompt Adaptation

    Jul 10, 2026Xingyu Zhu, Huanshen Wu, Shuo Wang +4VLM RobustnessVLM Adaptation

  20. Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

    Jul 10, 2026Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen +1Animal Re-IdentificationDistribution Shift

  21. CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding

    Jul 9, 2026Yuri Ishitoya, Jeremy Siburian, Masashi Hamaya +3VLM AdaptationRobotic Manipulation

  22. When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

    Jul 8, 2026Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe +2Vision-Language ModelsVLM Adaptation

  23. Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

    Jul 8, 2026Miguel Lopez-Duran, Elena Marrero, Julian Fierrez +8VLM EvaluationDocument Understanding

  24. GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

    Jul 8, 2026Peter Bohm, Saimunur Rahman, Abdelwahed Khamis +3VLM AdaptationRobot Navigation

  25. MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation

    Jul 7, 2026Jiaju Han, Ma Yaqi, Yahui Chai +8Remote Sensing Image UnderstandingVLM Adaptation

  26. Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

    Jul 7, 2026Xinda Liu, Qinyu Zhang, Weiqing Min +2VLM AdaptationFine-Grained Image Classification