Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. Harness Compilation: Which Decisions Should a Small Vision-Language Model Keep?

    Oct 8, 2026Minhao Fan, Yinyi Liu, Jiayu Zhao +3Tool Use in VLMsVision-Language Models

  2. Why VLMs Miss Small Objects, and When Zooming In Is Safe

    Oct 7, 2026Junzhe Shi, Yuan Gan, Shida JiangVision-Language ModelsVLM Inference

  3. SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning

    Oct 6, 2026Hairong Yin, Huangying Zhan, Shin-Fang Chng +2Vision-Language ModelsSpatiotemporal Reasoning

  4. Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

    Oct 6, 2026Ziyuan Yang, Wenxuan Ding, Shangbin Feng +1Vision-Language ModelsSafety Filtering

  5. Semantic Capability Acquisition and Specialization During Vision-Language Model Fine-Tuning

    Oct 5, 2026Suguru Onda, Matthew Bailey, Ryan FarrellVision-Language ModelsVLM Adaptation

  6. Improving Proactive AI Assistance with Hierarchical Procedural Understanding

    Oct 5, 2026Jin-Seop Lee, TaeYeon Won, SeongJun Jung +5Vision-Language ModelsProactive Assistance

  7. Fitting Vision Adapters at Frontier Scales

    Oct 5, 2026Jaehoon Lee, Harry Partridge, Mudith Jayasekara +3Vision-Language ModelsVLM Adaptation

  8. SPACE-CLIPv2: Decoding Local Geometry from Frozen CLIP for Monocular Depth Estimation

    Oct 4, 2026Hyun Song, Taewan Cho, Kangmin Kim +1Vision-Language ModelsVision Foundation Models

  9. LightVLN: Efficient Aerial Vision-and-Language Navigation with Compact Memory and History-Guided Local Aggregation

    Oct 4, 2026Yiming Zhao, Tianshun Li, Jingle He +2Memory-Augmented VLMsVision-Language Models

  10. Anti-Persona: Disrupting Unauthorized Identity Binding and Recognition in Personalized Vision--Language Models

    Oct 1, 2026Abhishek Basu, Fahad Shamshad, Karthik NandakumarVLM RobustnessVision-Language Models

  11. Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference

    Oct 1, 2026Xinye Zhao, Yunkai Dang, Yunchen Wu +1Vision-Language ModelsEfficient VLM Inference

  12. Fusing Visual and Textual Representations via Multi-layer Fusing Transformers for Vietnamese Visual Question Answering

    Oct 1, 2026Cong Phu Nguyen, Huy Tien Nguyen, Tung LeVisual Question AnsweringVision-Language Models

  13. AiSearch: Interactive Multi-Modal Search with VLMs

    Oct 1, 2026Ali Koksal, Mei Chee Leong, Vicky Sintunata +2Multimodal IRVision-Language Models

  14. Geometric Similarity in VLM Low-Level Vision Representations

    Oct 1, 2026Shao-Jun Xia, Huixin Zhang, Zhen Lei +3Vision-Language ModelsRepresentational Similarity Analysis

  15. Is Better Teacher Supervision Enough? Unlocking Student-side Learning in Multimodal On-Policy Distillation

    Sep 30, 2026Siyuan Liu, Kanghui Tian, Yue Duan +4Vision-Language ModelsVisual Reasoning

  16. CRAFT: Causal Responsibility and Failure Tracing in Medical Vision Language Models

    Sep 30, 2026Chunzheng Zhu, Jiaqi Zeng, Hongbo Zhao +3Vision-Language ModelsMedical VQA

  17. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Vision-Language ModelsLarge Vision-Language Models

  18. Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs

    Sep 29, 2026Hung-Jen Chen, Yu-Heng Ho, Ting-Yao Huang +4Vision-Language ModelsFew-Shot Domain Adaptation

  19. From Routing Signals to Selective Review: Visual regrounding in MoE VLMs

    Sep 29, 2026Hongzhu Guo, Mohsen Fayyaz, Nanyun PengHallucination Detection in VLMsVision-Language Models

  20. Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment

    Sep 29, 2026Haotian Deng, Wenbin Xing, Gang Xu +5VLM RobustnessVision-Language Models

  21. Are In-Context Images Worth 10 Dimensions?

    Sep 29, 2026Adhemar de Senneville, Xavier Bou, Jérémy Anger +2Vision-Language ModelsMultimodal ICL

  22. Targeted Visual Counterfactual Explanations for Contrastive Vision-Language Model

    Sep 29, 2026Van Bach Nguyen, Jörg Schlötterer, Christin SeiferVision-Language ModelsVLM Interpretability

  23. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Vision-Language ModelsEfficient VLM Inference

  24. DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing

    Sep 29, 2026Jae-Ho Lee, Jeong-Eun Lee, Gyeong-Moon ParkVision-Language ModelsLarge Vision-Language Models

  25. Xiaomi-OCR-0 Technical Report

    Sep 28, 2026Xin Chen, Anan Du, Feng Feng +7Vision-Language ModelsDocument Parsing

  26. Narrow Multimodal Fine-Tuning Can Induce Emergent Misalignment

    Sep 28, 2026Shunchang Liu, Lukas Fluri, Xin Chen +1Vision-Language ModelsFine-Tuning

  27. When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models

    Sep 28, 2026Yizhou Fang, Siyue Chen, Zimo Qi +3VLM EvaluationVision-Language Models

  28. AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors

    Sep 28, 2026Mohamed Eltahir, Fardows Adam, Duaa M. Tahir +6Vision-Language ModelsVLM Interpretability

  29. ControlTrace: Recovering Control Fields for Hidden-Content Recognition

    Sep 28, 2026Zijian Liu, Yaoguang Chen, Liwei Liu +4VLM EvaluationVision-Language Models

  30. Before the Token Commits: Trajectory-Level Benchmarking of Visual Hallucinations in Diffusion VLMs

    Sep 28, 2026Yadong Wang, Siping Yue, Yu Tian +2VLM EvaluationVision-Language Models

  31. Do Emotion Concepts Generalize Across Sources, Modalities, and Architectures in Vision-Language Models?

    Sep 28, 2026Bohao Xing, Xin Liu, Kaishen Yuan +5Cross-Modal LearningVision-Language Models

  32. Program-Verified Self-Evolution for Vision-Language Models

    Sep 27, 2026Ahmed Heakl, Sungik Choi, Moontae Lee +1Visual Question AnsweringVision-Language Models

  33. Seeing and Solving Are Not Enough for Vision-Language Models

    Sep 27, 2026Ziheng Wang, Mingxuan Xie, Yilin Liu +3VLM EvaluationVisual Question Answering

  34. ViCoR: Reliable Molecular Structure Extraction via Spatially Aligned Verification and Executable Revision

    Sep 27, 2026Yujian Yuan, Xin Cai, Yufan Chen +5Vision-Language ModelsOptical Character Recognition

  35. CoViST: Visual Token Compression via Composable States

    Sep 27, 2026Qi Zhang, Xiandong Meng, Ronggang Wang +1Vision-Language ModelsEfficient VLM Inference

  36. Where Hallucinations Live: A Cross-Architecture Circuit in VQ-Tokenized Vision-Language Models

    Sep 24, 2026Shamanthak Hegde, Xiangrui Liu, Maitreya Patel +1Vision-Language ModelsObject Hallucination in VLMs

  37. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Vision-Language ModelsVLM Adaptation

  38. What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior

    Sep 21, 2026Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak +4Vision-Language ModelsVLM Interpretability

  39. Hierarchical Prompt Learning for Hyperbolic Vision-Language Models

    Sep 21, 2026Andro Erdelez, Pascal Mettes, Behzad BozorgtabarVision-Language ModelsPrompt Learning

  40. SKstars at SHROOM: Visions Agreement-Guided Ensembling of Zero-Shot and LoRA-Adapted Vision--Language Models

    Sep 21, 2026Ali Athar, Imran Ahsan, Joon-Yong JungHallucination Detection in VLMsVision-Language Models

  41. BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring

    Sep 20, 2026Liuyang Song, Yi Zhang, Zhongyi Deng +2Vision-Language ModelsVision-Language Grounding

  42. Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification

    Sep 17, 2026Alkesh K. Srivastava, Jonathan Diller, Vijay Kumar +1Belief-Space PlanningVision-Language Models

  43. Absence is Presence: Understanding Visual Scene Negative Events Under Safety Cognitive Constraint

    Sep 17, 2026Zhiyun Jiang, Hanyong Wang, Binbin Liang +3Image CaptioningVision-Language Models

  44. ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement

    Sep 14, 2026Yan Zhu, Yongbo Chen, Zhengming Ding +1Vision-Language ModelsPrototype Learning

  45. ExpertHTR: Unified Handwritten Text Recognition with Multi-Task Learning and Sparse Mixture-of-Experts

    Sep 14, 2026Dang Hoai Nam, Nguyen Duy Hieu, Quang Huu Hieu +1Vision-Language ModelsSparse Mixture-of-Experts

  46. Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

    Sep 12, 2026Dieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3Vision-Language Models

  47. Can Edge-Deployable Vision-Language Models Identify Species?

    Sep 12, 2026William Zhou, Mayukha Siripuram, Xiao Yan +2VLM EvaluationVLM Robustness

  48. VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models

    Sep 10, 2026Zaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain +6VLM EvaluationVision-Language Models

  49. From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection

    Sep 9, 2026Xiao An, Ruikang Zhang, Chen Zhong +4Vision-Language ModelsRemote Sensing Change Detection