VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

    Apr 24, 2026Xiangxi Zheng, Kuang He, Jiayi Hu +6RL for Code GenerationVLM Adaptation

  2. Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection

    Apr 23, 2026Wenxuan Bao, Yanjun Zhao, Xiyuan Yang +1VLM RobustnessTest-Time Adaptation

  3. Prototype-Based Test-Time Adaptation of Vision-Language Models

    Apr 23, 2026Zhaohong Huang, Yuxin Zhang, Wenjing Liu +2Test-Time AdaptationVLM Adaptation

  4. Reasoning About Traversability: Language-Guided Off-Road 3D Trajectory Planning

    Apr 23, 2026Byounggun Park, Soonmin HwangVLM AdaptationMotion Planning

  5. InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

    Apr 22, 2026Nicklas Neu, Thomas Ebner, Jasmin Primus +4VLM AdaptationMedical VLMs

  6. Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

    Apr 22, 2026Xingyu Zhu, Junfeng Fang, Shuo Wang +4Vision-Language ModelsVLM Adaptation

  7. EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

    Apr 21, 2026Yiyang Du, Zhanqiu Guo, Xin Ye +2VLM AdaptationVision-Language-Action Models

  8. Hierarchically Robust Zero-shot Vision-language Models

    Apr 20, 2026Junhao Dong, Yifei Zhang, Hao Zhu +2Hierarchical ClassificationVLM Robustness

  9. ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification

    Apr 20, 2026Florian Kittler, Sheethal Bhat, Andreas MaierVLM RobustnessChest X-Ray Classification

  10. GR4CIL: Gap-compensated Routing for CLIP-based Class Incremental Learning

    Apr 20, 2026Tianqi Wang, Jingcai GuoClass-Incremental LearningVLM Adaptation

  11. Source-Free Domain Adaptation with Vision-Language Prior

    Apr 20, 2026Song Tang, Yunxiang Bai, Wenxin Su +3Source-Free Domain AdaptationCross-Modal Knowledge Distillation

  12. BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs

    Apr 19, 2026Mainak Singha, Tanisha Gupta, Ankit Jha +3Cross-Modal LearningPrompt Learning

  13. Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

    Apr 19, 2026Kangyi Wu, Pengna Li, Kailin Lyu +5VLM AdaptationVision-Language Navigation

  14. Enhancing Zero-shot Personalized Image Aesthetics Assessment with Profile-aware Multimodal LLM

    Apr 19, 2026Chun Wang, Chenfeng Wei, Chenyang Liu +1Zero-Shot LearningPersonalized Image Aesthetics Assessment

  15. Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

    Apr 19, 2026Lijie ZhouCross-Modal LearningVLM Robustness

  16. MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

    Apr 18, 2026Bo Li, Ningyuan Deng, Tianyu Dong +3Fine-TuningVLM Adaptation

  17. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

    Apr 17, 2026Yige Xu, Yongjie Wang, Zizhuo Wu +3Vision-Language ModelsVLM Adaptation

  18. S-GRPO: Unified Post-Training for Large Vision-Language Models

    Apr 17, 2026Yuming Yan, Kai Tang, Sihong Chen +4VLM AdaptationGroup Relative Policy Optimization

  19. TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models

    Apr 17, 2026Jinlun Ye, Jiang Liao, Runhe Lai +4Prompt LearningTest-Time Adaptation

  20. P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models

    Apr 17, 2026Geunyoung Jung, Soohong Kim, Kyungwoo Song +1Point Cloud ClassificationVLM Adaptation

  21. AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

    Apr 16, 2026Peifeng Zhang, Zice Qiu, Donghua Yu +4Visual Question AnsweringVision-Language Models

  22. BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

    Apr 15, 2026Baoyou Chen, Hanchen Xia, Peng Tu +5Vision-Language ModelsVLM Adaptation

  23. Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

    Apr 14, 2026Jungwon Choi, Eunwoo KimVLM RobustnessVLM Adaptation

  24. A Progressive Training Strategy for Embodied Vision-Language Models to Mitigate Spatio-Temporal Hallucinations

    Apr 12, 2026Xiaoda Yang, Shuai Yang, Can Wang +9VLM AdaptationVLM Hallucination

  25. VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

    Apr 10, 2026Guanyu Zhou, Yida Yin, Wenhao Chai +3Visual Question AnsweringSynthetic Data Augmentation

  26. Holistic Optimal Label Selection for Robust Prompt Learning under Partial Labels

    Apr 8, 2026Yaqi Zhao, Haoliang Sun, Yating Wang +2Prompt LearningVLM Adaptation

  27. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

    Apr 1, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Cross-Modal LearningVLM Adaptation