Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

    Jun 8, 2026Pangyun Jeong, Jiyeong Kong, Yuehua Hu +2Vision-Language ModelsVLM Adaptation

  2. One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

    Jun 6, 2026Qiyu Xu, Zhanxuan Hu, Yu Duan +4Vision-Language ModelsUnsupervised Domain Adaptation

  3. Textual Supervision Enhances Geospatial Representations in Vision-Language Models

    Jun 5, 2026Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon +5Vision-Language ModelsGeospatial Representation Learning

  4. NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation

    Jun 5, 2026Juan Manuel Delfa Victoria, Taran Cyriac John, Andrew W. HersonRemote Sensing Image UnderstandingVision-Language Models

  5. Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

    Jun 4, 2026Qian Zhang, Michal Golovanevsky, Fulvio Domini +1VLM EvaluationVision-Language Models

  6. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

    Jun 4, 2026Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3Vision-Language ModelsVLM Adaptation

  7. Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

    Jun 4, 2026Haoyu Zhou, Qing Qing, Caichong Li +6VLM EvaluationVision-Language Models

  8. Would you still call this Dax? Novel Visual References in VLMs and Humans

    Jun 3, 2026Ada Defne Tür, Gaurav Kamath, Joyce Chai +2VLM EvaluationVision-Language Models

  9. Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning

    Jun 3, 2026Yu Zhu, Yongkang Li, Wenjie Zhu +5Vision-Language ModelsVLM Reasoning

  10. Stateful Visual Encoders for Vision-Language Models

    Jun 3, 2026Zirui Wang, Junwei Yu, Adam Yala +3Vision-Language ModelsVisual Representation Learning

  11. A Dataset for Dynamic Human Preferences for Vision Language Models

    Jun 2, 2026Hannah Gao, Dylan Hadfield-Menell, Rachel MaVLM EvaluationHuman Preference Evaluation

  12. MAOAM: Unified Object and Material Selection with Vision-Language Models

    Jun 2, 2026Jaden Park, Valentin Deschaintre, Jason Kuen +5Vision-Language ModelsText-Guided Image Segmentation

  13. Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

    Jun 2, 2026Wei Ding, Yudong Zhang, Ruobing Xie +3VLM EvaluationVision-Language Models

  14. When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

    Jun 2, 2026Jiahui Wang, Kai Zhang, Mai Han +1Vision-Language ModelsEfficient VLM Inference

  15. Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy

    Jun 2, 2026Soohyun Lee, Jaeyoung Kim, Seokhyeon Park +5VLM EvaluationData Visualization

  16. TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

    Jun 2, 2026Jizhihui Liu, Ruizi Han, Miao Zhang +4Vision-Language ModelsEfficient VLM Inference

  17. FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction

    Jun 2, 2026Chang Kong, Yuebing Li, Peng Mo +2Synthetic Data AugmentationVision-Language Models

  18. Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View

    Jun 1, 2026Dongdong Wang, Alina Hagen, Isabelle Gatmaitan +5VLM EvaluationVision-Language Models

  19. STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

    Jun 1, 2026Yuhang Han, Wenzheng Yang, Yujie Chen +4Vision-Language ModelsKV Caching

  20. Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

    Jun 1, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1VLM RobustnessVision-Language Models

  21. On the Limits of Token Reduction for Efficient Unified Vision Language Training

    May 31, 2026Siyi Chen, Weiming Zhuang, Jingtao Li +1Vision-Language ModelsUnified Multimodal Models

  22. Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

    May 31, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +10Vision-Language ModelsMultimodal Pretraining

  23. Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

    May 30, 2026Rashid MushkaniVLM EvaluationInter-Rater Reliability

  24. T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

    May 30, 2026Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee +1Thermal ImagingImage Captioning

  25. LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models

    May 30, 2026Haiyu Wang, Yutong Wang, Leshu Li +2Vision-Language ModelsEfficient VLM Inference

  26. Detect Before You Leap: Mirage Detection in Vision-Language Models

    May 29, 2026Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed +1Hallucination Detection in VLMsVision-Language Models