Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs

    Jun 21, 2026Hao Vo, Phu Loc Nguyen, Khoa Vo +7Multi-View GeometryVision-Language Models

  2. Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

    Jun 21, 2026Haodi Liu, Xinhang Yang, Kunda Yan +3Vision-Language ModelsHuman Activity Recognition

  3. The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

    Jun 19, 2026Serdar Ozsoy, Lars Doorenbos, Federico Spurio +2Temporal Action SegmentationVision-Language Models

  4. BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

    Jun 19, 2026Rithvik Jonna, Aakash Gurram, Man Namgung +2Vision-Language ModelsEmbodied Navigation

  5. FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

    Jun 19, 2026Juntong Peng, Qi Chen, Deyuan Qu +3Vision-Language ModelsVLMs for Autonomous Driving

  6. Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

    Jun 19, 2026Sergio Lanza, Jae Hee Lee, Stefan WermterVision-Language ModelsVLM Interpretability

  7. The Hidden Evolution of Disguised Visual Context inside the VLM

    Jun 18, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Vision-Language ModelsLarge Vision-Language Models

  8. LaViSA: A Language and Vision Structural Ambiguity Benchmark

    Jun 17, 2026Lee Sangmyeong, Shun Inadumi, Koichiro YoshinoVLM EvaluationVision-Language Models

  9. Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

    Jun 17, 2026Sihan Wang, Xiyao Liu, Lianqing Liu +1Vision-Language ModelsOn-Policy Self-Distillation

  10. AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

    Jun 17, 2026Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz +8Vision-Language ModelsLarge Vision-Language Models

  11. ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks

    Jun 17, 2026Simon Schwaiger, David Seyser, Alessandro Scherl +2Vision-Language ModelsVision-Language Grounding

  12. Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

    Jun 17, 2026Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng +2VLM EvaluationVLM Robustness

  13. Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

    Jun 17, 2026Nan Zhou, Ke Zou, Meng Liu +5Hallucination Detection in VLMsVision-Language Models

  14. EventDrive: Event Cameras for Vision-Language Driving Intelligence

    Jun 16, 2026Dongyue Lu, Rong Li, Ao Liang +6Autonomous Driving DatasetsEvent-Based Vision

  15. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  16. Attention Alignment Between Humans and Vision-Language Models

    Jun 16, 2026Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld +4VLM EvaluationVisual Attention

  17. Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

    Jun 16, 2026Logan Mann, Yi Xia, Ajit Saravanan +6VLM EvaluationVLM Robustness

  18. Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

    Jun 15, 2026Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna +2VLM EvaluationVLM Robustness

  19. OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

    Jun 14, 2026Jiali Wen, Hongxia Gao, Litao Li +4Visual Question AnsweringVision-Language Models

  20. Mirage Probes: How Vision Models Fake Visual Understanding

    Jun 11, 2026Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao +5Vision-Language ModelsVLM Interpretability

  21. Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

    Jun 11, 2026Wei Li, Zhen Huang, Xinmei TianCross-Modal LearningVision-Language Models

  22. The Vision Encoder as a Privacy Boundary: Visual-Token Side Channels in Encoder-Free Vision-Language Models

    Jun 10, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Vision-Language ModelsAdversarial Attacks

  23. Vector Map as Language: Toward Unified Remote Sensing Vector Mapping

    Jun 9, 2026Yinglong Yan, Yunkai Yang, Haoyi Wang +7Remote Sensing Image UnderstandingVision-Language Models

  24. Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

    Jun 9, 2026Pratham Singla, Shivank Garg, Vihan Singh +1VLM EvaluationVision-Language Models

  25. Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

    Jun 8, 2026Eduardo Borges, Manuel Abreu, Luís Garrote +1VLM EvaluationVision-Language Models

  26. An Effective Router for Vision-Language Model Selection

    Jun 8, 2026Can Wang, Shengwei Wang, Bolin Zhang +2Vision-Language Models