VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. Vision Language Model Helps Private Information De-Identification in Vision Data

    Jun 8, 2026Tiejin Chen, Pingzhi Li, Kaixiong Zhou +2VLM AdaptationPrivacy Protection in VLMs

  2. Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

    Jun 8, 2026Pangyun Jeong, Jiyeong Kong, Yuehua Hu +2Vision-Language ModelsVLM Adaptation

  3. Harnessing Streaming Video in the Wild

    Jun 7, 2026Dingyu Yao, Shuhuan Gu, Qingyi Si +8VLM EvaluationStreaming Video Understanding

  4. Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data

    Jun 7, 2026Linqi Yin, Shiduo Zhang, Shenling Qiu +11VLM AdaptationVision-Language-Action Models

  5. One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

    Jun 6, 2026Qiyu Xu, Zhanxuan Hu, Yu Duan +4Vision-Language ModelsUnsupervised Domain Adaptation

  6. Learning a Semantic Calibration Network for Open-Vocabulary Semantic Segmentation

    Jun 6, 2026Yang Sun, Tao Wang, Anastasia Ioannou +1VLM AdaptationOpen-Vocabulary Semantic Segmentation

  7. Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

    Jun 6, 2026Zekai Zhang, Qinghui Chen, Maomao Xiong +6VLM AdaptationIndustrial Anomaly Detection

  8. Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

    Jun 6, 2026Zekai Zhang, Jinglin Zhang, Qinghui Chen +8Open-Vocabulary Object DetectionVLM Adaptation

  9. GP-Adapter: Gaussian Process CLIP-Adapter for Few-Shot Out-of-Distribution Detection

    Jun 5, 2026Taisei Saito, Koretaka Ogata, Takafumi HiroiVLM AdaptationFew-Shot Image Classification

  10. CL-CLIP: CLIP-Based Continual Learning Framework with Cost-Volume Category Decoupling for Object Detection

    Jun 5, 2026Zihan Liu, Yuguang Yang, Shengjie Su +5VLM AdaptationObject Detection

  11. SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

    Jun 5, 2026Sunoh Kim, Daeho UmVLM RobustnessVLM Adaptation

  12. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

    Jun 5, 2026Yifan Xu, Chao Zhang, Ruifei Ma +4VLM AdaptationVision-Language Alignment

  13. EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

    Jun 4, 2026Hao Wang, Qiwei Zeng, Jinghao Lin +6VLM AdaptationMedical Image Anomaly Detection

  14. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

    Jun 4, 2026Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3Vision-Language ModelsVLM Adaptation

  15. Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models

    Jun 3, 2026Tran Dinh Tien, Zhiqiang ShenVLM AdaptationVLM Distillation

  16. VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

    Jun 3, 2026Siyuan Yang, Linzheng Guo, Ouyang Lu +10VLM AdaptationRobotic Data Collection

  17. Stateful Visual Encoders for Vision-Language Models

    Jun 3, 2026Zirui Wang, Junwei Yu, Adam Yala +3Vision-Language ModelsVisual Representation Learning

  18. Frames2LoRA: Parametric Video Internalization for Vision-Language Models

    Jun 3, 2026Manan Suri, Sarvesh Baskar, Dinesh ManochaVLM AdaptationEfficient VLM Inference

  19. Visual Instruction Tuning Aligns Modalities through Abstraction

    Jun 2, 2026Luis Palacios, Lorenzo Basile, Diego Doimo +1VLM AdaptationVLM Interpretability

  20. Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset

    Jun 1, 2026David J. Lerch, Sarath Mulugurthi, Manuel Martin +2VLM EvaluationVLM Adaptation

  21. Low-Rank Adaptation of Frozen Vision-Language Models for Blind Image Quality Assessment

    Jun 1, 2026Bishr Omer Adam, Xu LiVLM AdaptationLow-Rank Adaptation

  22. Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

    Jun 1, 2026Muyi Bao, Yuxin Cai, Hang Xu +7Embodied NavigationVLM Adaptation

  23. Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

    May 30, 2026Yeqi Huang, Yue Chen, Yanwei Ye +2VLM AdaptationSynthetic Data Generation

  24. T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

    May 30, 2026Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee +1Thermal ImagingImage Captioning

  25. Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation

    May 29, 2026Pau Montagut Bofi, Mario García Blasco, Tessa Pulli +1Mobile ManipulationVLM Adaptation

  26. "Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

    May 29, 2026Mihai Masala, Marius Leordeanu, Mihai Dascalu +1VLM EvaluationVision-Language Models

  27. FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

    May 29, 2026Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand +2VLM EvaluationVLM Adaptation

  28. Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval

    May 29, 2026Alicja Dobrzeniecka, Filip Szatkowski, Sebastian Cygert +2Multimodal IRVLM Adaptation

  29. A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models

    May 29, 2026Iosif Tsangko, Andreas Triantafyllopoulos, George Margetis +2Image CaptioningVLM Adaptation