VLM Adaptation

VLM: Vision-Language Model

Latest papers 395

All topics
CardsList
  1. Curvature-Guided Mixing for MLLM Adaptation

    Jun 23, 2026Jinglong Yang, Jiaxuan He, Wenjian Huang +2VLM AdaptationMultimodal Large Language Models

  2. TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation

    Jun 23, 2026Sachin Sharma, Michele Flammini, Federico SimonettaFine-TuningVLM Adaptation

  3. Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies

    Jun 22, 2026Zhenyu Yi, Zhiyun Song, Yusong Sun +6VLM Adaptation3D Medical Imaging

  4. CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

    Jun 22, 2026Amrita Singh, Rishabh JhaVLM AdaptationElastic Weight Consolidation

  5. T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

    Jun 22, 2026Jaehyuk Jang, Minseok Seo. Seungju Cho, Kangwook Ko +1VLM RobustnessVLM Adaptation

  6. Concept-Constrained Prompt Learning for Few-Shot CLIP Adaptation

    Jun 21, 2026Na Sang, Ding Ma, Rui Sang +1Prompt LearningVLM Adaptation

  7. Robot Critics that Sweat the Small Stuff

    Jun 19, 2026Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan +3Robot Failure DetectionVLM Adaptation

  8. Semi-Supervised Vision-Language-Action Model

    Jun 19, 2026Hongyang He, Jiuming Liu, Victor SanchezVLM AdaptationVision-Language-Action Models

  9. FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

    Jun 18, 2026Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen +20VLM AdaptationEfficient VLA Models

  10. Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

    Jun 18, 2026Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka +2Chest X-Ray ClassificationRadiology VLMs

  11. SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

    Jun 18, 2026Bo Yin, Xiaobin Hu, Chengming Xu +6VLM RobustnessVLM Adaptation

  12. A Unified Framework for Efficient Remote Sensing Visual Question Answering: Adapting Dual, Hybrid, and Encoder-Decoder Architectures

    Jun 17, 2026Timothy Agboada, Shikha Chandel, Yadav Raj Ghimire +1Remote Sensing Image UnderstandingVisual Question Answering

  13. Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos

    Jun 17, 2026Runze Xu, Yiluo Zhang, Jian Wang +2Latent Action LearningVLM Adaptation

  14. APT: Atomic Physical Transitions for Causal Video-Language Understanding

    Jun 17, 2026Shang Wu, Haoran Lu, Songling Liu +6VLM AdaptationCausal Reasoning in Videos

  15. Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

    Jun 16, 2026Sneha Paul, Zachary Patterson, Nizar BouguilaMultimodal RobustnessVLM Adaptation

  16. Uncertainty Quantification for Flow-Based Vision-Language-Action Models

    Jun 16, 2026Ralf Römer, Maximilian Seeliger, Saida Liu +5Flow MatchingUncertainty Estimation for VLA Models

  17. Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

    Jun 16, 2026Jinghan Wu, Jing Li, Ivor W. Tsang +1Coreference ResolutionVLM Adaptation

  18. KeepLoRA++: Continual Learning with Layer-Scaled Residual Gradient Adaptation

    Jun 15, 2026Mao-Lin Luo, Yi-Lin Zhang, Zi-Hao Zhou +5VLM AdaptationContinual Learning for VLMs

  19. CPS4: Class Prompt driven Semi-Supervised Spine Segmentation with Class-specific Consistency Constraint

    Jun 14, 2026Qingtao Pan, Hongzan Sun, Bing Ji +1VLM AdaptationText-Guided Image Segmentation

  20. Label Shift Aware Adaptation for Online Zero-shot Learning with Contrastive Language-Image Pre-Training (CLIP)

    Jun 13, 2026Pengxiao Han, Changkun Ye, Yanshuo Wang +5Source-Free Domain AdaptationZero-Shot Learning

  21. Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models

    Jun 12, 2026Chenyu Zhou, Qiliang Jiang, Boguang PanVLM AdaptationVision-Language Grounding

  22. What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

    Jun 12, 2026Jiazhen Huang, Xiao Chen, Zhiming Liu +3VLM EvaluationTest-Time Adaptation

  23. Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning

    Jun 11, 2026Jeffrin Sam, Dzmitry TsetserukouVLM AdaptationVision-Language-Action Models

  24. Zero-Shot Captioning for Cultural Heritage: Automated Image Analysis of Traditional Indonesian Clothing

    Jun 11, 2026Anugrah Aidin Yotolembah, Novanto Yudistira, Gembong Edhi SetyawanRetrieval-Augmented GenerationImage Captioning

  25. Multi-Label Test-Time Adaptation with Bayesian Conditional Priors

    Jun 11, 2026Qiru Li, Ao Zhou, Zhiwei Jiang +4Multi-Label ClassificationTest-Time Adaptation

  26. Bridging the Morphology Gap: Adapting VLA Models to Dexterous Manipulation via Intent-Conditioned Fine-Tuning

    Jun 10, 2026Chuanke Pang, Junyi Huang, Zhijun Zhao +3Contact-Rich Robotic ManipulationVLM Adaptation

  27. Adapting Vision-Language Models from Iconic to Inclusive for Multi-Label Recognition Without Labels

    Jun 10, 2026Cheng Chen, Jingyu Zhou, Yifan Zhao +1Multi-Label ClassificationVLM Adaptation

  28. SceneMiner: Identity-Preserving Multi-Task Fine-Tuning for Unified BEV Scene Mining

    Jun 9, 2026Abdalmalek Aburaddaha, Venkatraman Narayanan, Keval Thaker +1VLM AdaptationGradient Interference

  29. Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models

    Jun 8, 2026Danya Li, Xiang Su, Yan Feng +1Pedestrian Intention PredictionVLM Adaptation