Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

    May 7, 2026Hoin Jung, Xiaoqian WangMultimodal RAGMultimodal Grounding

  2. How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study

    May 6, 2026Junran Wang, Xinjie Shen, Zehao Jin +1VLM EvaluationVision-Language Models

  3. DiCLIP: Diffusion Model Enhances CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation

    May 6, 2026Zhiwei Yang, Pengfei Song, Yucong Meng +3Vision-Language ModelsWeakly Supervised Image Segmentation

  4. Memory-Efficient Continual Learning with CLIP Models

    May 5, 2026Ryan King, Gang Li, Bobak Mortazavi +1Class-Incremental LearningContrastive Learning

  5. Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning Benchmarks

    May 5, 2026JuneHyoung Kwon, MiHyeon Kim, Eunju Lee +3VLM EvaluationVLM Unlearning

  6. Neuroscience-Inspired Analyses of Visual Interestingness in Multimodal Transformers

    May 5, 2026Mathis Immertreu, Fitim Abdullahu, Thomas Kinfe +3Transformer InterpretabilityVision-Language Models

  7. MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

    May 5, 2026Kangkang Wang, Qinting Jiang, Wanping Zhang +2VLM EvaluationVision-Language Models

  8. MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

    May 2, 2026Yin Zhang, Jiaxuan Zhao, Zonghan Wu +5Vision-Language ModelsReinforcement Learning

  9. Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

    May 2, 2026Muyang Li, Yucheng Liu, Jianbo Ma +3Vision-Language ModelsVision-Language Alignment

  10. Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

    May 1, 2026Siyuan Huang, Xiaoye Qu, Yafu Li +6Memory-Augmented VLMsVLM Robustness

  11. Jailbreaking Vision-Language Models Through the Visual Modality

    May 1, 2026Aharon Azulay, Jan Dubiński, Zhuoyun Li +2Adversarial Attacks on VLMsVision-Language Models

  12. Leveraging Vision-Language Models as Weak Annotators in Active Learning

    May 1, 2026Phuong Ngoc Nguyen, Kaito Shiku, Ryoma Bise +2Vision-Language ModelsActive Learning

  13. Online Self-Calibration Against Hallucination in Vision-Language Models

    May 1, 2026Minghui Chen, Chenxu Yang, Hengjie Zhu +3Vision-Language ModelsHallucination in Language Models

  14. TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

    Apr 30, 2026Ce Chen, Yi Ren, Yuanming Li +5Vision-Language ModelsChange-Point Detection

  15. Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

    Apr 30, 2026Xiaomeng Wang, Martha Larson, Zhengyu ZhaoVLM EvaluationVision-Language Models

  16. Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis

    Apr 30, 2026David Fernandez, Pedram MohajerAnsari, Amir Salarpour +1Adversarial Attacks on VLMsVision-Language Models

  17. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Vision-Language ModelsVision-Language Grounding

  18. Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

    Apr 28, 2026Chengsheng Zhang, Chenghao Sun, Xinyan Jiang +2Vision-Language ModelsHallucination in Language Models

  19. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2VLM EvaluationVision-Language Models

  20. A systematic evaluation of vision-language models for observational astronomical reasoning tasks

    Apr 27, 2026Wenke Ren, Hengxiao Guo, Wenwen Zuo +1VLM EvaluationVision-Language Models

  21. PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

    Apr 27, 2026Sinin Zhang, Yunfei Xie, Yuxuan Cheng +2Vision-Language ModelsVLM Reasoning

  22. Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs

    Apr 27, 2026Byeonggeuk Lim, JungMin Yun, Junehyoung Kwon +2Vision-Language ModelsHallucination in Language Models

  23. SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

    Apr 27, 2026Arya Shah, Deepali Mishra, Chaklam SilpasuwanchaiVLM EvaluationVision-Language Models

  24. PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

    Apr 25, 2026Tianlong Yu, Yang Yang, Ziyi Zhou +5Vision-Language ModelsCybersecurity

  25. SketchVLM: Vision language models can annotate images to explain thoughts and guide users

    Apr 23, 2026Brandon Collins, Logan Bolton, Hung Huy Nguyen +3Vision-Language ModelsLLM-Assisted Annotation