Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference

    May 12, 2026Hao Zhu, Shuo Jin, Wenbin Liao +4Image SegmentationVision-Language Models

  2. Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

    May 12, 2026Yaofang Liu, Kangning Cui, Meng Chu +7Vision-Language ModelsConditional Image Generation

  3. UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

    May 12, 2026Shuo Ni, Tong Wang, Jing Zhang +5VLM EvaluationRemote Sensing Image Understanding

  4. DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

    May 12, 2026Hongyi Tang, Zhihao Zhu, Yi YangVision-Language ModelsMembership Inference Attacks

  5. Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

    May 12, 2026Antoni Valls, Jordi Sanchez-RieraVisual Question AnsweringVision-Language Models

  6. Revisiting Shadow Detection from a Vision-Language Perspective

    May 12, 2026Yonghui Wang, Shaokai Liu, Wengang Zhou +2Vision-Language Models

  7. Personal Visual Context Learning in Large Multimodal Models

    May 11, 2026Zihui Xue, Ami Baid, Sangho Kim +2Vision-Language ModelsMultimodal Large Language Models

  8. Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

    May 11, 2026Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur +4VLM EvaluationVision-Language Models

  9. Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

    May 11, 2026Ruinan Jin, Beidi Zhao, Myeongkyun Kang +2VLM EvaluationVision-Language Models

  10. LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models

    May 11, 2026Nikolaos Gkalelis, Vasileios MezarisVision-Language ModelsEfficient VLM Inference

  11. MFVLR: Multi-domain Fine-grained Vision-Language Reconstruction for Generalizable Diffusion Face Forgery Detection and Localization

    May 11, 2026Yaning Zhang, Tianyi Wang, Zan Gao +3Vision-Language ModelsImage Forgery Detection

  12. The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

    May 11, 2026Xia Hu, Zhenrui Yue, Brian Potetz +4VLM EvaluationSpatial Reasoning Benchmarks

  13. Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

    May 10, 2026Xuan Gong, Hanbo Huang, Hao Zheng +4Vision-Language ModelsVision-Language Grounding

  14. KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection

    May 9, 2026Haozhe Luo, Shelley Zixin Shu, Ziyu Zhou +2VLM RobustnessRadiology VLMs

  15. ZAYA1-VL-8B Technical Report

    May 8, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsMixture-of-Experts Language Models

  16. PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

    May 8, 2026Yuliang Li, Chu Zhou, Heng Guo +3Visual Question AnsweringVision-Language Models

  17. Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

    May 8, 2026Peitao Han, Fei Cheng, Lis K. Pereira +2Vision-Language ModelsTemporal Reasoning in Language Models

  18. Hierarchical Dual-Subspace Decoupling for Continual Learning in Vision-Language Models

    May 8, 2026Mengxin Qin, Xiang Zhang, Kun Wei +2Class-Incremental LearningVision-Language Models

  19. DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models

    May 8, 2026Mengxin Qin, Xiang Zhang, Xi Wang +3Vision-Language ModelsFine-Tuning

  20. ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

    May 8, 2026Yuhao Zhou, Yunpeng Zhu, Yang Zhou +7Vision-Language ModelsEfficient VLA Models

  21. GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

    May 8, 2026Yu Pan, Andi Zhang, Yi Wang +2Diffusion Model AlignmentAdversarial Attacks on VLMs

  22. GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

    May 7, 2026Pranav Mantini, Shishir K. ShahVision-Language ModelsVLM Adaptation

  23. PlotPick: AI-powered batch extraction of numerical data from scientific figures

    May 7, 2026Tommy CarstensenData VisualizationVision-Language Models

  24. When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

    May 7, 2026Harshvardhan Saini, Samyak Jha, Yiming Tang +1Vision-Language ModelsObject Hallucination in VLMs

  25. VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading

    May 7, 2026Cheng Xu, Xiaofeng Hou, Jiacheng Liu +1Expert OffloadingVision-Language Models

  26. Large Vision-Language Models Get Lost in Attention

    May 7, 2026Gongli Xi, Ye Tian, Mengyu Yang +5Transformer FFNsVision-Language Models