Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models

    Sep 28, 2026Yizhou Fang, Siyue Chen, Zimo Qi +3VLM EvaluationVision-Language Models

  2. AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors

    Sep 28, 2026Mohamed Eltahir, Fardows Adam, Duaa M. Tahir +6Vision-Language ModelsVLM Interpretability

  3. ControlTrace: Recovering Control Fields for Hidden-Content Recognition

    Sep 28, 2026Zijian Liu, Yaoguang Chen, Liwei Liu +4VLM EvaluationVision-Language Models

  4. Before the Token Commits: Trajectory-Level Benchmarking of Visual Hallucinations in Diffusion VLMs

    Sep 28, 2026Yadong Wang, Siping Yue, Yu Tian +2VLM EvaluationVision-Language Models

  5. Do Emotion Concepts Generalize Across Sources, Modalities, and Architectures in Vision-Language Models?

    Sep 28, 2026Bohao Xing, Xin Liu, Kaishen Yuan +5Cross-Modal LearningVision-Language Models

  6. Program-Verified Self-Evolution for Vision-Language Models

    Sep 27, 2026Ahmed Heakl, Sungik Choi, Moontae Lee +1Visual Question AnsweringVision-Language Models

  7. Seeing and Solving Are Not Enough for Vision-Language Models

    Sep 27, 2026Ziheng Wang, Mingxuan Xie, Yilin Liu +3VLM EvaluationVisual Question Answering

  8. ViCoR: Reliable Molecular Structure Extraction via Spatially Aligned Verification and Executable Revision

    Sep 27, 2026Yujian Yuan, Xin Cai, Yufan Chen +5Vision-Language ModelsOptical Character Recognition

  9. CoViST: Visual Token Compression via Composable States

    Sep 27, 2026Qi Zhang, Xiandong Meng, Ronggang Wang +1Vision-Language ModelsEfficient VLM Inference

  10. Where Hallucinations Live: A Cross-Architecture Circuit in VQ-Tokenized Vision-Language Models

    Sep 24, 2026Shamanthak Hegde, Xiangrui Liu, Maitreya Patel +1Vision-Language ModelsObject Hallucination in VLMs

  11. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Vision-Language ModelsVLM Adaptation

  12. What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior

    Sep 21, 2026Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak +4Vision-Language ModelsVLM Interpretability

  13. Hierarchical Prompt Learning for Hyperbolic Vision-Language Models

    Sep 21, 2026Andro Erdelez, Pascal Mettes, Behzad BozorgtabarVision-Language ModelsPrompt Learning

  14. SKstars at SHROOM: Visions Agreement-Guided Ensembling of Zero-Shot and LoRA-Adapted Vision--Language Models

    Sep 21, 2026Ali Athar, Imran Ahsan, Joon-Yong JungHallucination Detection in VLMsVision-Language Models

  15. BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring

    Sep 20, 2026Liuyang Song, Yi Zhang, Zhongyi Deng +2Vision-Language ModelsVision-Language Grounding

  16. Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification

    Sep 17, 2026Alkesh K. Srivastava, Jonathan Diller, Vijay Kumar +1Belief-Space PlanningVision-Language Models

  17. Absence is Presence: Understanding Visual Scene Negative Events Under Safety Cognitive Constraint

    Sep 17, 2026Zhiyun Jiang, Hanyong Wang, Binbin Liang +3Image CaptioningVision-Language Models

  18. ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement

    Sep 14, 2026Yan Zhu, Yongbo Chen, Zhengming Ding +1Vision-Language ModelsPrototype Learning

  19. ExpertHTR: Unified Handwritten Text Recognition with Multi-Task Learning and Sparse Mixture-of-Experts

    Sep 14, 2026Dang Hoai Nam, Nguyen Duy Hieu, Quang Huu Hieu +1Vision-Language ModelsSparse Mixture-of-Experts

  20. Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

    Sep 12, 2026Dieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3Vision-Language Models

  21. Can Edge-Deployable Vision-Language Models Identify Species?

    Sep 12, 2026William Zhou, Mayukha Siripuram, Xiao Yan +2VLM EvaluationVLM Robustness

  22. VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models

    Sep 10, 2026Zaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain +6VLM EvaluationVision-Language Models

  23. From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection

    Sep 9, 2026Xiao An, Ruikang Zhang, Chen Zhong +4Vision-Language ModelsRemote Sensing Change Detection