Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

    Aug 8, 2026Qian Yao, Jun-Jie Huang, Yongjun Wang +1Vision-Language ModelsAI-Generated Image Detection

  2. Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

    Aug 7, 2026Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn +3VLM EvaluationVisual Question Answering

  3. SABRE: Scalable and Automated Benchmarking of VLMs under Stress

    Aug 7, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Robustness

  4. Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

    Aug 7, 2026Zichuan Wang, Songlin Yang, Bo Peng +4Hallucination Detection in VLMsVision-Language Models

  5. Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders

    Aug 7, 2026Rahul Murali Shankar, Titus von der Malsburg, Sebastian PadóVision-Language ModelsComputational Psycholinguistics

  6. Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

    Aug 7, 2026Minseok Kang, Hyunwoo Kim, Chanyoung Kim +3Vision-Language ModelsEfficient VLM Inference

  7. Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading

    Aug 6, 2026Rasul Khanbayov, Hasan KurbanVLM EvaluationVision-Language Models

  8. DynaPix: Can Vision-Language Models Identify the Exact Future?

    Aug 6, 2026Thong Nguyen, Vinh-Hien Do, Quynh Vo +2VLM EvaluationVision-Language Models

  9. Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

    Aug 5, 2026Weihan Cai, Hao Tan, Zichang Tan +2Prototype-Based ClassificationVision-Language Models

  10. Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

    Aug 5, 2026Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian +1VLM EvaluationVLM Robustness

  11. Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

    Aug 5, 2026Han Chen, Ming Li, Hong Jiao +1Vision-Language ModelsEducational Assessment

  12. Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

    Aug 5, 2026Hongyu Zhang, Cheng Yan, Xiang Xia +1Vision-Language ModelsMixture of Experts

  13. ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

    Aug 4, 2026Yang Yang, Qinyu Zhao, Mouxiang Chen +5Vision-Language ModelsMultimodal Large Language Models

  14. MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

    Aug 4, 2026Gengyuan Liu, Nanzhou Wang, Chang Liu +5Vision-Language ModelsVLM Adaptation

  15. UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

    Aug 4, 2026Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia +4Hallucination Detection in VLMsVision-Language Models

  16. Can Text-to-Image Models Draw from the Right Frame of Reference?

    Aug 4, 2026Zheyuan Gu, Ruihang Li, Yong Huang +5Vision-Language ModelsT2I Generation

  17. In-Context Collapse in Vision-Language Models and How to Mitigate it?

    Aug 3, 2026Mohammad RostamiVLM RobustnessVision-Language Models

  18. HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

    Aug 3, 2026Jin Cui, Chuanchang Su, Jiayi Lu +3Visual Question AnsweringVLM Robustness

  19. TALSC: Timeliness-Aware Large-Small VLM Collaboration for Infrastructure-Assisted Autonomous Driving

    Aug 3, 2026Mengmeng Zhu, Yuxuan Sun, Wei Chen +1Vision-Language ModelsVLMs for Autonomous Driving

  20. DiffPrune: differentiable information throttling for token pruning in vision-language models

    Aug 3, 2026Landi He, Mingde Yao, Shawn Young +1Vision-Language ModelsEfficient VLM Inference

  21. Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

    Aug 3, 2026Wenxiao Fan, Jingling Fu, Fang Li +9Vision-Language ModelsVLM Reasoning

  22. SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

    Aug 3, 2026Jing Wu, Jianhua Wu, Jiayi Guan +5Vision-Language ModelsVisual Spatial Reasoning

  23. DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

    Aug 3, 2026Yongkang Zhou, Xiang Xia, Cheng Yan +2Vision-Language ModelsEfficient VLM Inference

  24. Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

    Aug 3, 2026Xiaohao Yang, Aohua Tian, Derek Van Berkel +2VLM EvaluationVision-Language Models

  25. Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

    Aug 3, 2026Ashfak Yeafi, Mehedi Hasan, Md Khairul IslamMemory-Augmented VLMsVision-Language Models

  26. Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

    Aug 2, 2026Jianmin Chen, Jiaqi Tang, Wei Wei +9Vision-Language ModelsLong-Context Modeling

  27. Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

    Aug 2, 2026Khondoker Ittehadul IslamVLM EvaluationVision-Language Models