VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. Variational Adapter for Cross-modal Similarity Representation

    May 29, 2026WenZhang Wei, Zhipeng Gui, Dehua Peng +2Cross-Modal Representation LearningVLM Adaptation

  2. LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

    May 28, 2026Feng Han, Zhixiong Zhang, Zheming Liang +2Cross-Modal LearningVLM Robustness

  3. Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning

    May 28, 2026Shuai Yi, Yixiong Zou, Yuhua Li +1Source-Free Domain AdaptationFew-Shot Domain Adaptation

  4. GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

    May 27, 2026Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi DerakhshaniDiffusion Model Alignment3D Asset Generation

  5. AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning

    May 27, 2026Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei ZhouClass-Incremental LearningVision-Language Models

  6. Toward Semantic-Agnostic and Shape-Aware Vision-Language Segmentation Models

    May 27, 2026Corentin Seutin, Mohamed Amine Ettaki, Michaël Clément +2VLM AdaptationText-Guided Image Segmentation

  7. FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models

    May 27, 2026Xucong Wang, Pengkun Wang, Zhe Zhao +3Multi-Label ClassificationVLM Adaptation

  8. VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

    May 27, 2026Rui Lin, Chuanming Wang, Huadong MaVLM AdaptationVideo Representation Learning

  9. Rethinking Video-Language Model from the Language Input Perspective

    May 27, 2026Xiang Fang, Wanlong Fang, Changshuo Wang +2VLM AdaptationVideo-Language Models

  10. Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning

    May 27, 2026Yuting Ma, Lechao Cheng, Xiaohua XuVLM AdaptationVision-Language Alignment

  11. Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

    May 27, 2026Takuya Murakawa, Toru TamakiVLM AdaptationVideo QA

  12. COVD: Continual Open-Vocabulary Object Detection with Novel Concept Injection

    May 26, 2026Yupeng Zhang, Ruize Han, Yuzhong Feng +3Open-Vocabulary Object DetectionVLM Adaptation

  13. FAST-GOAL: Fast and Efficient Global-local Object Alignment Learning

    May 26, 2026Hyungyu Choi, Young Kyun Jang, Chanho EomVLM AdaptationText-Image Alignment

  14. FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

    May 26, 2026Guixian Xu, Yide Liang, Zeli Su +5VLM EvaluationVision-Language Models

  15. HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

    May 26, 2026Senyuan Shi, Hao Tan, Zichang Tan +4Image Forgery DetectionVLM Adaptation

  16. Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

    May 25, 2026Xiao Liu, Jiaxiang Liu, Boci Peng +6VLM RobustnessPrompt Learning

  17. Rethinking VLM Representation for VLA Initialization

    May 25, 2026Weifeng Lin, Siyuan Huang, Hao Li +5VLM AdaptationLow-Rank Adaptation

  18. Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

    May 25, 2026Shuai Yi, Yixiong Zou, Yuhua Li +1Source-Free Domain AdaptationFew-Shot Domain Adaptation

  19. MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

    May 25, 2026Kaixiang Chen, Pengfei Fang, Hui XueCross-Modal LearningCross-Modal Representation Learning

  20. Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

    May 24, 2026Yangneng Chen, Jing LiVision-Language ModelsVLM Adaptation

  21. QuoVLA: Quotient Space for Vision-Language-Action Models

    May 24, 2026Xuan Wang, Yinan Wu, Haoran Duan +1Representation LearningVLM Adaptation

  22. VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

    May 23, 2026Bo Li, Ronghao Chen, Ningyuan Deng +3VLM AdaptationLarge Vision-Language Models