Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. LaViSA: A Language and Vision Structural Ambiguity Benchmark

    Jun 17, 2026Lee Sangmyeong, Shun Inadumi, Koichiro YoshinoVLM EvaluationVision-Language Models

  2. Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

    Jun 17, 2026Sihan Wang, Xiyao Liu, Lianqing Liu +1Vision-Language ModelsOn-Policy Self-Distillation

  3. AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

    Jun 17, 2026Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz +8Vision-Language ModelsLarge Vision-Language Models

  4. ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks

    Jun 17, 2026Simon Schwaiger, David Seyser, Alessandro Scherl +2Vision-Language ModelsVision-Language Grounding

  5. Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

    Jun 17, 2026Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng +2VLM EvaluationVLM Robustness

  6. Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

    Jun 17, 2026Nan Zhou, Ke Zou, Meng Liu +5Hallucination Detection in VLMsVision-Language Models

  7. EventDrive: Event Cameras for Vision-Language Driving Intelligence

    Jun 16, 2026Dongyue Lu, Rong Li, Ao Liang +6Autonomous Driving DatasetsEvent-Based Vision

  8. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  9. Attention Alignment Between Humans and Vision-Language Models

    Jun 16, 2026Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld +4VLM EvaluationVisual Attention

  10. Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

    Jun 16, 2026Logan Mann, Yi Xia, Ajit Saravanan +6VLM EvaluationVLM Robustness

  11. Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

    Jun 15, 2026Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna +2VLM EvaluationVLM Robustness

  12. OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

    Jun 14, 2026Jiali Wen, Hongxia Gao, Litao Li +4Visual Question AnsweringVision-Language Models

  13. Mirage Probes: How Vision Models Fake Visual Understanding

    Jun 11, 2026Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao +5Vision-Language ModelsVLM Interpretability

  14. Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

    Jun 11, 2026Wei Li, Zhen Huang, Xinmei TianCross-Modal LearningVision-Language Models

  15. The Vision Encoder as a Privacy Boundary: Visual-Token Side Channels in Encoder-Free Vision-Language Models

    Jun 10, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Vision-Language ModelsAdversarial Attacks

  16. Vector Map as Language: Toward Unified Remote Sensing Vector Mapping

    Jun 9, 2026Yinglong Yan, Yunkai Yang, Haoyi Wang +7Remote Sensing Image UnderstandingVision-Language Models

  17. Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

    Jun 9, 2026Pratham Singla, Shivank Garg, Vihan Singh +1VLM EvaluationVision-Language Models

  18. Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

    Jun 8, 2026Eduardo Borges, Manuel Abreu, Luís Garrote +1VLM EvaluationVision-Language Models

  19. An Effective Router for Vision-Language Model Selection

    Jun 8, 2026Can Wang, Shengwei Wang, Bolin Zhang +2Vision-Language Models

  20. Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

    Jun 8, 2026Pangyun Jeong, Jiyeong Kong, Yuehua Hu +2Vision-Language ModelsVLM Adaptation

  21. One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

    Jun 6, 2026Qiyu Xu, Zhanxuan Hu, Yu Duan +4Vision-Language ModelsUnsupervised Domain Adaptation

  22. Textual Supervision Enhances Geospatial Representations in Vision-Language Models

    Jun 5, 2026Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon +5Vision-Language ModelsGeospatial Representation Learning

  23. NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation

    Jun 5, 2026Juan Manuel Delfa Victoria, Taran Cyriac John, Andrew W. HersonRemote Sensing Image UnderstandingVision-Language Models

  24. Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

    Jun 4, 2026Qian Zhang, Michal Golovanevsky, Fulvio Domini +1VLM EvaluationVision-Language Models

  25. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

    Jun 4, 2026Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3Vision-Language ModelsVLM Adaptation

  26. Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

    Jun 4, 2026Haoyu Zhou, Qing Qing, Caichong Li +6VLM EvaluationVision-Language Models

  27. Would you still call this Dax? Novel Visual References in VLMs and Humans

    Jun 3, 2026Ada Defne Tür, Gaurav Kamath, Joyce Chai +2VLM EvaluationVision-Language Models