Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. Harness Compilation: Which Decisions Should a Small Vision-Language Model Keep?

    Oct 8, 2026Minhao Fan, Yinyi Liu, Jiayu Zhao +3Tool Use in VLMsVision-Language Models

  2. Why VLMs Miss Small Objects, and When Zooming In Is Safe

    Oct 7, 2026Junzhe Shi, Yuan Gan, Shida JiangVision-Language ModelsVLM Inference

  3. SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning

    Oct 6, 2026Hairong Yin, Huangying Zhan, Shin-Fang Chng +2Vision-Language ModelsSpatiotemporal Reasoning

  4. Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

    Oct 6, 2026Ziyuan Yang, Wenxuan Ding, Shangbin Feng +1Vision-Language ModelsSafety Filtering

  5. Semantic Capability Acquisition and Specialization During Vision-Language Model Fine-Tuning

    Oct 5, 2026Suguru Onda, Matthew Bailey, Ryan FarrellVision-Language ModelsVLM Adaptation

  6. Improving Proactive AI Assistance with Hierarchical Procedural Understanding

    Oct 5, 2026Jin-Seop Lee, TaeYeon Won, SeongJun Jung +5Vision-Language ModelsProactive Assistance

  7. Fitting Vision Adapters at Frontier Scales

    Oct 5, 2026Jaehoon Lee, Harry Partridge, Mudith Jayasekara +3Vision-Language ModelsVLM Adaptation

  8. SPACE-CLIPv2: Decoding Local Geometry from Frozen CLIP for Monocular Depth Estimation

    Oct 4, 2026Hyun Song, Taewan Cho, Kangmin Kim +1Vision-Language ModelsVision Foundation Models

  9. LightVLN: Efficient Aerial Vision-and-Language Navigation with Compact Memory and History-Guided Local Aggregation

    Oct 4, 2026Yiming Zhao, Tianshun Li, Jingle He +2Memory-Augmented VLMsVision-Language Models

  10. Anti-Persona: Disrupting Unauthorized Identity Binding and Recognition in Personalized Vision--Language Models

    Oct 1, 2026Abhishek Basu, Fahad Shamshad, Karthik NandakumarVLM RobustnessVision-Language Models

  11. Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference

    Oct 1, 2026Xinye Zhao, Yunkai Dang, Yunchen Wu +1Vision-Language ModelsEfficient VLM Inference

  12. Fusing Visual and Textual Representations via Multi-layer Fusing Transformers for Vietnamese Visual Question Answering

    Oct 1, 2026Cong Phu Nguyen, Huy Tien Nguyen, Tung LeVisual Question AnsweringVision-Language Models

  13. AiSearch: Interactive Multi-Modal Search with VLMs

    Oct 1, 2026Ali Koksal, Mei Chee Leong, Vicky Sintunata +2Multimodal IRVision-Language Models

  14. Geometric Similarity in VLM Low-Level Vision Representations

    Oct 1, 2026Shao-Jun Xia, Huixin Zhang, Zhen Lei +3Vision-Language ModelsRepresentational Similarity Analysis

  15. Is Better Teacher Supervision Enough? Unlocking Student-side Learning in Multimodal On-Policy Distillation

    Sep 30, 2026Siyuan Liu, Kanghui Tian, Yue Duan +4Vision-Language ModelsVisual Reasoning

  16. CRAFT: Causal Responsibility and Failure Tracing in Medical Vision Language Models

    Sep 30, 2026Chunzheng Zhu, Jiaqi Zeng, Hongbo Zhao +3Vision-Language ModelsMedical VQA

  17. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Vision-Language ModelsLarge Vision-Language Models

  18. Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs

    Sep 29, 2026Hung-Jen Chen, Yu-Heng Ho, Ting-Yao Huang +4Vision-Language ModelsFew-Shot Domain Adaptation

  19. From Routing Signals to Selective Review: Visual regrounding in MoE VLMs

    Sep 29, 2026Hongzhu Guo, Mohsen Fayyaz, Nanyun PengHallucination Detection in VLMsVision-Language Models

  20. Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment

    Sep 29, 2026Haotian Deng, Wenbin Xing, Gang Xu +5VLM RobustnessVision-Language Models

  21. Are In-Context Images Worth 10 Dimensions?

    Sep 29, 2026Adhemar de Senneville, Xavier Bou, Jérémy Anger +2Vision-Language ModelsMultimodal ICL

  22. Targeted Visual Counterfactual Explanations for Contrastive Vision-Language Model

    Sep 29, 2026Van Bach Nguyen, Jörg Schlötterer, Christin SeiferVision-Language ModelsVLM Interpretability

  23. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Vision-Language ModelsEfficient VLM Inference

  24. DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing

    Sep 29, 2026Jae-Ho Lee, Jeong-Eun Lee, Gyeong-Moon ParkVision-Language ModelsLarge Vision-Language Models

  25. Xiaomi-OCR-0 Technical Report

    Sep 28, 2026Xin Chen, Anan Du, Feng Feng +7Vision-Language ModelsDocument Parsing

  26. Narrow Multimodal Fine-Tuning Can Induce Emergent Misalignment

    Sep 28, 2026Shunchang Liu, Lukas Fluri, Xin Chen +1Vision-Language ModelsFine-Tuning