Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

    May 1, 2026Siyuan Huang, Xiaoye Qu, Yafu Li +6Memory-Augmented VLMsVLM Robustness

  2. Jailbreaking Vision-Language Models Through the Visual Modality

    May 1, 2026Aharon Azulay, Jan Dubiński, Zhuoyun Li +2Adversarial Attacks on VLMsVision-Language Models

  3. Leveraging Vision-Language Models as Weak Annotators in Active Learning

    May 1, 2026Phuong Ngoc Nguyen, Kaito Shiku, Ryoma Bise +2Vision-Language ModelsActive Learning

  4. Online Self-Calibration Against Hallucination in Vision-Language Models

    May 1, 2026Minghui Chen, Chenxu Yang, Hengjie Zhu +3Vision-Language ModelsHallucination in Language Models

  5. TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

    Apr 30, 2026Ce Chen, Yi Ren, Yuanming Li +5Vision-Language ModelsChange-Point Detection

  6. Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

    Apr 30, 2026Xiaomeng Wang, Martha Larson, Zhengyu ZhaoVLM EvaluationVision-Language Models

  7. Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

    Apr 30, 2026David Fernandez, Pedram MohajerAnsari, Amir Salarpour +1Adversarial Attacks on VLMsVision-Language Models

  8. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Vision-Language ModelsVision-Language Grounding

  9. Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

    Apr 28, 2026Chengsheng Zhang, Chenghao Sun, Xinyan Jiang +2Vision-Language ModelsHallucination in Language Models

  10. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2VLM EvaluationVision-Language Models

  11. A systematic evaluation of vision-language models for observational astronomical reasoning tasks

    Apr 27, 2026Wenke Ren, Hengxiao Guo, Wenwen Zuo +1VLM EvaluationVision-Language Models

  12. PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

    Apr 27, 2026Sinin Zhang, Yunfei Xie, Yuxuan Cheng +2Vision-Language ModelsVLM Reasoning

  13. Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs

    Apr 27, 2026Byeonggeuk Lim, JungMin Yun, Junehyoung Kwon +2Vision-Language ModelsHallucination in Language Models

  14. SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

    Apr 27, 2026Arya Shah, Deepali Mishra, Chaklam SilpasuwanchaiVLM EvaluationVision-Language Models

  15. PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

    Apr 25, 2026Tianlong Yu, Yang Yang, Ziyi Zhou +5Vision-Language ModelsCybersecurity

  16. SketchVLM: Vision language models can annotate images to explain thoughts and guide users

    Apr 23, 2026Brandon Collins, Logan Bolton, Hung Huy Nguyen +3Vision-Language ModelsLLM-Assisted Annotation

  17. Source-Modality Monitoring in Vision-Language Models

    Apr 23, 2026Etha Tianze Hua, Tian Yun, Ellie PavlickVision-Language ModelsMultimodal Understanding

  18. R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Hallucination Detection in VLMsVision-Language Models

  19. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Vision-Language ModelsHallucination in Language Models

  20. Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

    Apr 22, 2026Xingyu Zhu, Junfeng Fang, Shuo Wang +4Vision-Language ModelsVLM Adaptation

  21. Detecting AI-Generated Content on Social Media with Multi-modal Language Models

    Apr 21, 2026Chenyang Yang, Shen Yan, Yibo Yang +13Vision-Language ModelsAI-Generated Image Detection

  22. PLaMo 2.1-VL Technical Report

    Apr 21, 2026Tommi Kerola, Yuya Masuda, Takashi Masuko +5Visual Question AnsweringVision-Language Models

  23. Disparities In Negation Understanding Across Languages In Vision-Language Models

    Apr 21, 2026Charikleia Moraitaki, Sarah Pan, Skyler Pulling +3VLM EvaluationVision-Language Models

  24. ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

    Apr 20, 2026Clayton Fields, Casey KenningtonVision-Language ModelsEfficient ViTs