Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding

    May 19, 2026Hanqing Liu, Mingjie Liu, Luoping Cui +3Visual Question AnsweringEvent-Based Vision

  2. iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

    May 19, 2026Xuezhi Cui, Dongbo Zhou, Wang Guo +8Vision-Language ModelsVLM Adaptation

  3. EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

    May 18, 2026Dongyan Lin, Phillip Rust, Angel Villar Corrales +19VLM EvaluationVision-Language Models

  4. CATA: Continual Machine Unlearning via Conflict-Averse Task Arithmetic

    May 18, 2026Shen Lin, Junhao Dong, Rongjie Chen +3VLM UnlearningVision-Language Models

  5. Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

    May 18, 2026Yuhuan Wu, Cong Wei, Fangzhen Lin +2Vision-Language ModelsVLM Adaptation

  6. What's Holding Back Latent Visual Reasoning?

    May 18, 2026André G. Viveiros, Nuno Gonçalves, André F. T. Martins +1Vision-Language ModelsLatent Visual Reasoning

  7. Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

    May 18, 2026Junming Liu, Yuqi Li, Yifei Sun +6VLM RobustnessVision-Language Models

  8. CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

    May 18, 2026Yang Liu, Toan Nguyen, Flora D. SalimContinual Learning for LLMsVision-Language Models

  9. CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

    May 18, 2026Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid +3VLM EvaluationVision-Language Models

  10. GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations

    May 18, 2026Zesheng Li, Chengchang Pan, Honggang QiVision-Language ModelsRepresentation Learning

  11. t-gems: text-guided exit modules for decreasing clip image encoder

    May 17, 2026Alberto Presta, Grzegorz Stefanski, Michal Byra +1Cross-Modal LearningVision-Language Models

  12. Medical Context Distorts Decisions in Clinical Vision Language Models

    May 17, 2026David Restrepo, Ira Ktena, Maria Vakalopoulou +2VLM EvaluationVLM Robustness

  13. ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding

    May 17, 2026Mingyang Rao, Kehua Feng, Zhihui Zhu +4Vision-Language ModelsVLM Reasoning

  14. Unlocking Dense Metric Depth Estimation in VLMs

    May 15, 2026Hanxun Yu, Xuan Qu, Yuxin Wang +2Vision-Language ModelsMetric Depth Estimation

  15. Neutral-Reference Prompting for Vision-Language Models

    May 15, 2026Senmao Tian, Xiang Wei, Shunli ZhangVision-Language ModelsVLM Adaptation

  16. KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

    May 14, 2026Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt +1Vision-Language ModelsEfficient VLM Inference

  17. Deep Pre-Alignment for VLMs

    May 14, 2026Tianyu Yu, Kechen Fang, Zihao Wan +5Vision-Language ModelsLarge Vision-Language Models

  18. MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

    May 14, 2026Wei Ding, Yilin Li, Yudong Zhang +4Vision-Language ModelsLLM Hallucination Mitigation

  19. MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

    May 14, 2026Xiyu Ren, Zhaowei Wang, Yiming Du +11VLM EvaluationMemory-Augmented VLMs

  20. Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

    May 14, 2026Sujung Hong, Chanyong Yoon, Seong Jae HwangVision-Language ModelsDiffusion Language Model Decoding

  21. Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

    May 13, 2026Zhaowei Wang, Lishu Luo, Haodong Duan +9Visual Question AnsweringVision-Language Models

  22. SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models

    May 13, 2026Vladislav Makarov, Mark Gizetdinov, Dmitry YudinScene Graph GenerationVision-Language Models

  23. GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

    May 13, 2026Mayank Nautiyal, Li Ju, Andreas Hellander +2Cross-Modal LearningFlow Matching

  24. Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

    May 13, 2026Ziqi Wen, Parsa Madinei, Miguel P. EcksteinVLM EvaluationVision-Language Models

  25. Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention

    May 12, 2026Hamza Ahmed Durrani, Rafay Suleman DurraniVision-Language ModelsCross-Modal Alignment

  26. Revealing Interpretable Failure Modes of VLMs

    May 12, 2026Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva +2VLM RobustnessVision-Language Models