Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

    May 25, 2026Aritra Dutta, Somak AdityaVision-Language ModelsEfficient VLM Inference

  2. Binding Visual Features Point by Point

    May 25, 2026Udith Haputhanthri, Declan Campbell, Rim Assouel +2Vision-Language ModelsVLM Interpretability

  3. Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

    May 25, 2026Ruoxi Cheng, Haoxuan Ma, Zhengfei Hai +6Adversarial Representation LearningVision-Language Models

  4. Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

    May 24, 2026Yangneng Chen, Jing LiVision-Language ModelsVLM Adaptation

  5. Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

    May 24, 2026Yuanzhi Xu, Qian Gao, Jun Fan +4VLM RobustnessVision-Language Models

  6. From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks

    May 23, 2026Bruce Changlong Xu, Jose James, Alexander RyuVision-Language ModelsMedical Image Classification

  7. Planktonzilla: Multimodal dataset and models for understanding plankton ecosystems

    May 22, 2026Alan Gerson Contreras Montanares, Luis Valenzuela, Luis Martí +1Vision-Language ModelsVision Foundation Models

  8. DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

    May 22, 2026Hao Vo, Khoa Vo, Phu Loc Nguyen +10VLM EvaluationAutonomous Driving Datasets

  9. Cambrian-P: Pose-Grounded Video Understanding

    May 21, 2026Jihan Yang, Zifan Zhao, Xichen Pan +5Vision-Language ModelsCamera Pose Estimation

  10. Seeing the Poem: Image-Semantic Detection of AI-Generated Modern Chinese Poetry with MLLMs

    May 21, 2026Shanshan Wang, Fengying Ye, Hanjia Lyu +6Vision-Language ModelsAI-Generated Text Detection

  11. HyLoVQA: Dynamic Hypernetwork-Generated Low-Rank Adaptation for Continual Visual Question Answering

    May 21, 2026Yiran Wang, Chenyi Xiong, Ziyue Qin +3Visual Question AnsweringVision-Language Models

  12. EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models

    May 21, 2026Shiqi Huang, Ziyue Wang, Zhongrong Zuo +3Vision-Language ModelsVideo Reasoning

  13. Visual-Advantage On-Policy Distillation for Vision-Language Models

    May 21, 2026Ruiqi Liu, Xiaolei Lv, Gengsheng Li +8Vision-Language ModelsVLM Distillation

  14. SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

    May 21, 2026Zihang Lin, Huaiyuan Qin, Muli Yang +1VLM EvaluationVision-Language Models

  15. Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

    May 21, 2026Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape +1Thermal ImagingVisual Question Answering

  16. BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

    May 20, 2026Gonçalo Gomes, Bruno Martins, Chrysoula ZervaVLM EvaluationImage Captioning

  17. Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens

    May 20, 2026Meng Shen, Minghao Wu, Deepu RajanVision-Language ModelsHallucination in Language Models

  18. Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

    May 20, 2026Yutong Xie, Zhenglin Hua, Ran Wang +3Vision-Language ModelsHallucination in Language Models

  19. Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models

    May 20, 2026Yulin Zhao, Zheng ZhangVision-Language ModelsEfficient VLM Inference

  20. RISE: Reliable Improvement in Self-Evolving Vision-Language Models

    May 20, 2026Chaoran Xu, Yingmao Miao, Pengfei Zhang +3Vision-Language ModelsVLM Adaptation

  21. A Human-in-the-Loop Framework for Efficient Prompt Selection in Microscopy Vision-Language Models

    May 19, 2026Abhiram Kandiyana, Ankur Mali, Lawrence O. Hall +2Vision-Language ModelsHuman-in-the-Loop Annotation

  22. HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

    May 19, 2026Haoyu Wang, Zitong LiVision-Language ModelsAudio-Language Model Hallucination Detection

  23. From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

    May 19, 2026Juncheng Wu, Hardy Chen, Haoqin Tu +6Vision-Language ModelsVLM Reasoning

  24. Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

    May 19, 2026Yi Zhong, Haotong Qin, Xindong Zhang +2Vision-Language ModelsVLM Quantization

  25. Mechanisms of Object Localization in Vision-Language Models

    May 19, 2026Timothy Schaumlöffel, Martina G. Vilas, Gemma RoigVision-Language ModelsVLM Interpretability

  26. Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

    May 19, 2026Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa +4Vision-Language ModelsNeural Encoding