VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. From Pixels to Structure: Lightweight Vision-Language Models for Document OCR and Structured JSON Extraction

    Oct 8, 2026Uddipan Basu Bir, Vincent Christlein, Andreas Maier +1Document Information ExtractionVLM Adaptation

  2. Rethinking Contrastive Loss in CLIP Post-training: A Complementary Framework with Frozen Text Encoder

    Oct 8, 2026Zidan Wang, Yaqian Li, Xiaokai Zhang +3VLM AdaptationVision-Language Models

  3. DiscoVL: Unveiling Disentangled C ross-Modal Representation Learning via Orthogonal Adversarial Regularization for V ision-Language Models

    Oct 8, 2026Mengping Dong, Jinbao Li, Fei LiVision-Language ModelsVLM Adaptation

  4. Unsupervised Long-Tailed Adaptation of Vision-Language Models

    Oct 6, 2026Keliang Chen, Yaxin Hou, Hui Liu +1Long-Tail LearningVLM Adaptation

  5. Unlocking Fine-Grained Perception in CLIP via Structurally-Aware Latent Masked Modeling

    Oct 6, 2026Juntong Li, Lingwei Dang, Haomin Wu +3VLM AdaptationDense Prediction

  6. Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings

    Oct 6, 2026Xi Ding, Naichen Shi, Jiawei ZhangMultimodal ICLTask Vectors

  7. Semantic Capability Acquisition and Specialization During Vision-Language Model Fine-Tuning

    Oct 5, 2026Suguru Onda, Matthew Bailey, Ryan FarrellVision-Language ModelsVLM Adaptation

  8. Sim-to-Real Transfer of Vision-Language Navigation in Continuous Environments Using an Ackermann-Steered Mobile Robot

    Oct 5, 2026Chalindu Abeywansa, Sahan Gunasekara, Devindi De Silva +3VLM AdaptationSim-to-Real Transfer

  9. ReMem: Streaming Video Understanding With Long Context Retention

    Oct 5, 2026Li Yiheng, He Xu, Wang Shaobo +2Memory-Augmented VLMsStreaming Video Understanding

  10. Fitting Vision Adapters at Frontier Scales

    Oct 5, 2026Jaehoon Lee, Harry Partridge, Mudith Jayasekara +3Vision-Language ModelsVLM Adaptation

  11. LAS-CLIP: A Lightweight Adapter Steering Approach for CLIP's Visual Encoder

    Oct 2, 2026Anh-Khoa Dinh-Duc, Duc-Tai Dinh, Tam V. Nguyen +1VLM AdaptationZero-Shot Image Classification

  12. Concept Driven Domain Adaptation: Finding an Abstract Needle in a Haystack

    Oct 1, 2026Haiming Zhao, Tai Wang, Kun Zhang +2VLM AdaptationVision-Language Alignment

  13. Platonic Task Arithmetic

    Oct 1, 2026Junghwan Park, Woojin ChoVLM AdaptationTask Arithmetic

  14. Comparative study of adapting pre-trained models for driving behavior video captioning

    Sep 30, 2026Sayak Mallick, Philipp Geiger, Augustin KelavaVLM AdaptationAutonomous Driving

  15. Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs

    Sep 29, 2026Hung-Jen Chen, Yu-Heng Ho, Ting-Yao Huang +4Vision-Language ModelsFew-Shot Domain Adaptation

  16. Scaling Full Conformal Image Classifiers

    Sep 29, 2026Julio Silva-Rodríguez, Ender KonukogluVLM AdaptationConformal Prediction

  17. EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception

    Sep 29, 2026Yaoxin Niu, Zhangquan Chen, Yang Zhang +5VLM AdaptationEfficient ViTs

  18. Reprogramming Vision-Language Models via Structured Prompt Reparameterization

    Sep 29, 2026Zizhao Li, Chengyi Cai, Mohammed Yaqoob Ansari +3VLM AdaptationFew-Shot Image Classification

  19. You Only Reprogram Once: Rethinking Prolonged Training for Visual Reprogramming

    Sep 29, 2026Zizhao Li, Mohammed Yaqoob Ansari, Xinyu Su +3VLM AdaptationVision Foundation Model Adaptation

  20. Benchmarking Vision-Language Models on Synapse Detection and Proofreading in Connectomics

    Sep 29, 2026Yicong Li, Junjie Wang, Leander Lauenburg +5VLM EvaluationVLM Adaptation

  21. ConvCue: Complementary Visual Inductive Biases for Vision-Language Models

    Sep 28, 2026Zixuan Lan, Shichu SunVisual Question AnsweringVLM Adaptation

  22. BIRD: Distilling Decision Boundaries into Rationales for MLLM Adaptation

    Sep 27, 2026Anglin Liu, Yanlin Wu, Ruichao Chen +6VLM AdaptationVLM Reasoning

  23. Prompt-Anchored Residual Adaptation for Biomedical Vision-Language Models

    Sep 27, 2026Jingxuan Kang, Qianying Yue, Che Liu +1VLM AdaptationFew-Shot Learning

  24. When Does Geometric View Synthesis Help Wine Label Retrieval? A Public One-Shot Benchmark Across Self-Supervised and Vision-Language Backbones

    Sep 27, 2026Yueh-Cheng HuangVLM AdaptationNovel View Synthesis

  25. From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model

    Sep 24, 2026Xunlan Zhou, Xianliang Yang, Li ZhaoVisual Question AnsweringVLM Adaptation

  26. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Vision-Language ModelsVLM Adaptation

  27. PrismGPT: Proxy-Guided Learning for Region-Aware Photo Editing with Self-Synthesized Reasoning

    Sep 21, 2026Ke Zhao, Hue Nguyen, Abhijith Punnappurath +3VLM AdaptationImage Editing

  28. HyperCLIP++: Fine-tuning CLIP forOpen-vocabulary Semantic Segmentation in Hyperbolic Space

    Sep 21, 2026Zelin Peng, Zhengqin Xu, Changsong Wen +4VLM AdaptationOpen-Vocabulary Semantic Segmentation