VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge

    May 23, 2026Zhiwei Chen, Yupeng Hu, Zixu Li +4Test-Time AdaptationVLM Adaptation

  2. Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation

    May 22, 2026Zixuan Hu, Xuantuo Huang, Yancheng Li +3VLM AdaptationContinual Test-Time Adaptation

  3. Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

    May 21, 2026David Méndez, Roberto Confalonieri, Natalia Díaz RodríguezCross-Modal LearningVLM Adaptation

  4. HyLoVQA: Dynamic Hypernetwork-Generated Low-Rank Adaptation for Continual Visual Question Answering

    May 21, 2026Yiran Wang, Chenyi Xiong, Ziyue Qin +3Visual Question AnsweringVision-Language Models

  5. Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

    May 21, 2026Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape +1Thermal ImagingVisual Question Answering

  6. RISE: Reliable Improvement in Self-Evolving Vision-Language Models

    May 20, 2026Chaoran Xu, Yingmao Miao, Pengfei Zhang +3Vision-Language ModelsVLM Adaptation

  7. MedExpMem: Adapting Experience Memory for Differential Diagnosis

    May 20, 2026Qianhan Feng, Zhongzhen Huang, Yakun Zhu +4Radiology VLMsHealthcare

  8. LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition

    May 19, 2026Jiaxin Wang, Muwei Jian, Hui Yu +2VLM AdaptationFacial Expression Recognition

  9. PrAda: Few-Shot Visual Adaptation for Text-Prompted Segmentation

    May 19, 2026Gabriele Rosi, Fabio Cermelli, Carlo Masone +1VLM AdaptationText-Guided Image Segmentation

  10. Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

    May 19, 2026Zhiyu Xu, Lean Wang, Yuanxin Liu +5VLM AdaptationModel Merging

  11. iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

    May 19, 2026Xuezhi Cui, Dongbo Zhou, Wang Guo +8Vision-Language ModelsVLM Adaptation

  12. Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

    May 18, 2026Yuhuan Wu, Cong Wei, Fangzhen Lin +2Vision-Language ModelsVLM Adaptation

  13. VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

    May 18, 2026Linan ZHU, Zihao Zhai, Xiao Han +4VLM AdaptationEmotion Recognition in Conversations

  14. PERL: Parameter Efficient Reasoning in CLIP Latent Space

    May 18, 2026Simone Carnemolla, Salvatore Calcagno, Daniela Giordano +2VLM AdaptationFew-Shot Learning

  15. Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

    May 18, 2026Junming Liu, Yuqi Li, Yifei Sun +6VLM RobustnessVision-Language Models

  16. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

    May 18, 2026Boyuan Sun, Bowen Yin, Yuanming Li +2Cross-Modal LearningVideo Object Segmentation

  17. SHED: Style-Homogenized Embedding Alignment for Domain Generalization

    May 16, 2026Kai Gan, Tong WeiVLM RobustnessVLM Adaptation

  18. VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis

    May 16, 2026Zeqin Liao, Peifan Ren, Zixu Gao +6VLM AdaptationSynthetic Data Generation for Robotics

  19. GeoWorld-VLM: Geometry from World Models for Vision-Language Models

    May 15, 2026Renjie Gu, Kaichen Zhou, Yan Luo +1Visual Spatial ReasoningVLM Adaptation

  20. Res2^2CLIP: Few-Shot Generalist Anomaly Detection with Residual-to-Residual Alignment

    May 15, 2026Xinyue Liu, Jianyuan Wang, Biao Leng +1Few-Shot Anomaly DetectionVLM Adaptation

  21. Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

    May 15, 2026Fabian Morelli, Arnas Uselis, Ankit Sonthalia +1Distribution Shift RobustnessVLM Robustness

  22. Neutral-Reference Prompting for Vision-Language Models

    May 15, 2026Senmao Tian, Xiang Wei, Shunli ZhangVision-Language ModelsVLM Adaptation

  23. COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

    May 14, 2026Darryl Cherian Jacob, Xinyu Liu, Kai Wang +1VLM AdaptationVideo Anomaly Detection

  24. PhysBrain 1.0 Technical Report

    May 14, 2026Shijie Lian, Bin Yu, Xiaopeng Lin +10VLM AdaptationVision-Language-Action Models