Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models

    Jul 6, 2026Khang Nhat Hoang Vo, Artem Vazhentsev, Artem Shelmanov +2VLM EvaluationVision-Language Models

  2. IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

    Jul 5, 2026Hao Wei, Wenjin Qi, Dasen Dai +2Visual Question AnsweringVision-Language Models

  3. Pathways of Visual Information Flow in Vision-Language Models

    Jul 3, 2026Israfel Salazar, Stella Frank, Dan Oneata +2Vision-Language ModelsVLM Interpretability

  4. VISTA: Auditing Semantic Divergence in Vision-Language Models

    Jul 3, 2026Junchi Liao, Jiawen Deng, Fuji RenVLM EvaluationVision-Language Models

  5. Prior Bias in Vision Language Models on UML Diagram Interpretation

    Jul 3, 2026Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio MastropaoloVLM EvaluationSoftware Engineering

  6. Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

    Jul 2, 2026Liyan Tang, Fangcong Yin, Greg DurrettVLM RobustnessVision-Language Models

  7. Show Me Examples: Inferring Visual Concepts from Image Sets

    Jul 2, 2026Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3Vision-Language ModelsConditional Image Generation

  8. FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

    Jul 2, 2026Zhenqi He, Ziqi Jiang, Yuanpei Liu +3Vision-Language ModelsComposed Image Retrieval

  9. SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

    Jul 2, 2026Qi Lyu, Jiahua Dong, Baichen Liu +7Model CompressionVision-Language Models

  10. Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

    Jul 1, 2026Yiqian Liu, Iuliia Kotseruba, John K. TsotsosVLM EvaluationVision-Language Models

  11. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  12. AdaBoosting Text Prompts for Vision-Language Models

    Jul 1, 2026Seokhee Jin, Changhwan Sung, Sunung Mun +2Vision-Language ModelsEnsemble Learning

  13. Caption Bottleneck Models

    Jul 1, 2026Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli +1Vision-Language ModelsConcept Bottleneck Models

  14. HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

    Jul 1, 2026Ji Ha Jang, Hayeon Kim, Chulwon Lee +2VLM RobustnessVision-Language Models

  15. From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

    Jun 29, 2026Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim +1VLM EvaluationVision-Language Models

  16. SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

    Jun 29, 2026Filippo Ruffini, Marco Salmé, Rosa Sicilia +2VLM EvaluationRadiology Report Generation

  17. FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models

    Jun 28, 2026Yichen Guo, Kai Tang, Fenglai Lin +5Vision-Language ModelsLarge Vision-Language Models

  18. Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

    Jun 28, 2026Xiao Wang, Liye Jin, Dan Xu +5Vision-Language ModelsVisual Object Tracking

  19. ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

    Jun 27, 2026Guanglong Sun, Shuang Cui, Bo Lei +6Memory-Augmented VLMsVision-Language Models

  20. MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

    Jun 26, 2026Nan Yang, Zhanwen Liu, Linfeng Zhang +4Vision-Language ModelsVLMs for Autonomous Driving

  21. From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

    Jun 24, 2026Haoxiang Sun, Tao Wang, Li Yuan +2Vision-Language ModelsMultimodal Large Language Models

  22. Data Selection Through Iterative Self-Filtering for Vision-Language Settings

    Jun 22, 2026Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss +1Vision-Language ModelsTraining Data Curation

  23. Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

    Jun 22, 2026Yu Cao, Ziquan Liu, Zhensong Zhang +3VLM EvaluationPhysical Consistency in Video Generation