Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

    Aug 11, 2026Shuai Wang, Wangyuan Ding, Yixian Shen +5Image CaptioningVision-Language Models

  2. Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

    Aug 11, 2026Yuhang Song, Bor-Jiun Lin, Jiaxu Liu +3Memory-Augmented VLMsVision-Language Models

  3. GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

    Aug 10, 2026Jiahui Cui, Yan Zhao, Kan Wei +4Vision-Language ModelsFine-Grained Image Retrieval

  4. TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

    Aug 9, 2026Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da QuachVision-Language ModelsPlant Disease Classification

  5. VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

    Aug 9, 2026Yuqi Zhang, Cheng Chen, Yuyu Guo +6Vision-Language ModelsEfficient VLM Inference

  6. LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

    Aug 8, 2026Qian Yao, Jun-Jie Huang, Yongjun Wang +1Vision-Language ModelsAI-Generated Image Detection

  7. Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

    Aug 7, 2026Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn +3VLM EvaluationVisual Question Answering

  8. SABRE: Scalable and Automated Benchmarking of VLMs under Stress

    Aug 7, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Robustness

  9. Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

    Aug 7, 2026Zichuan Wang, Songlin Yang, Bo Peng +4Hallucination Detection in VLMsVision-Language Models

  10. Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders

    Aug 7, 2026Rahul Murali Shankar, Titus von der Malsburg, Sebastian PadóVision-Language ModelsComputational Psycholinguistics

  11. Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

    Aug 7, 2026Minseok Kang, Hyunwoo Kim, Chanyoung Kim +3Vision-Language ModelsEfficient VLM Inference

  12. Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading

    Aug 6, 2026Rasul Khanbayov, Hasan KurbanVLM EvaluationVision-Language Models

  13. DynaPix: Can Vision-Language Models Identify the Exact Future?

    Aug 6, 2026Thong Nguyen, Vinh-Hien Do, Quynh Vo +2VLM EvaluationVision-Language Models

  14. Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

    Aug 5, 2026Weihan Cai, Hao Tan, Zichang Tan +2Prototype-Based ClassificationVision-Language Models

  15. Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

    Aug 5, 2026Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian +1VLM EvaluationVLM Robustness

  16. Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

    Aug 5, 2026Han Chen, Ming Li, Hong Jiao +1Vision-Language ModelsEducational Assessment

  17. Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

    Aug 5, 2026Hongyu Zhang, Cheng Yan, Xiang Xia +1Vision-Language ModelsMixture of Experts

  18. ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

    Aug 4, 2026Yang Yang, Qinyu Zhao, Mouxiang Chen +5Vision-Language ModelsMultimodal Large Language Models

  19. MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

    Aug 4, 2026Gengyuan Liu, Nanzhou Wang, Chang Liu +5Vision-Language ModelsVLM Adaptation

  20. UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

    Aug 4, 2026Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia +4Hallucination Detection in VLMsVision-Language Models

  21. Can Text-to-Image Models Draw from the Right Frame of Reference?

    Aug 4, 2026Zheyuan Gu, Ruihang Li, Yong Huang +5Vision-Language ModelsT2I Generation

  22. In-Context Collapse in Vision-Language Models and How to Mitigate it?

    Aug 3, 2026Mohammad RostamiVLM RobustnessVision-Language Models

  23. HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

    Aug 3, 2026Jin Cui, Chuanchang Su, Jiayi Lu +3Visual Question AnsweringVLM Robustness

  24. TALSC: Timeliness-Aware Large-Small VLM Collaboration for Infrastructure-Assisted Autonomous Driving

    Aug 3, 2026Mengmeng Zhu, Yuxuan Sun, Wei Chen +1Vision-Language ModelsVLMs for Autonomous Driving