Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. Same Answer, Different Representations: Hidden instability in VLMs

    Feb 6, 2026Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena +6VLM EvaluationVLM Robustness

  2. Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

    Jan 30, 2026Yanlong Chen, Amirhossein Habibian, Luca Benini +1Cross-Modal Knowledge DistillationVision-Language Models

  3. From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

    Jan 15, 2026Cheng Chen, Yuyu Guo, Pengpeng Zeng +4Vision-Language ModelsVLM Adaptation

  4. Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

    Jan 13, 2026Takamichi Miyata, Sumiko Miyata, Andrew MorrisVision-Language ModelsAutonomous Driving Perception

  5. CoMa: Contextual Massing Generation with Vision-Language Models

    Jan 13, 2026Evgenii Maslov, Alexandra Vabnits, Vladimir Vorona +6Vision-Language ModelsMultimodal Generation

  6. UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

    Jan 7, 2026Zhexiao Xiong, Xin Ye, Burhan Yaman +5Vision-Language ModelsWorld Model Learning

  7. Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

    Dec 16, 2025George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin CercelVisual Question AnsweringImage Captioning

  8. Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes

    Dec 16, 2025Joseph Hoche, Andrei Bursuc, David Brellmann +4Vision-Language ModelsUncertainty Quantification

  9. SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

    Dec 11, 2025Peizheng Li, Zhenghao Zhang, David Holtz +6Vision-Language ModelsVLMs for Autonomous Driving

  10. How (Mis)calibrated is your Federated CLIP and what to do about it?

    Dec 3, 2025Mainak Singha, Masih Aminbeidokhti, Paolo Casari +3Vision-Language ModelsVLM Adaptation

  11. Vision-Language Memory for Spatial Reasoning

    Nov 25, 2025Zuntao Liu, Yi Du, Taimeng Fu +3Memory-Augmented VLMsVision-Language Models

  12. T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

    Nov 20, 2025Shao-Jun Xia, Huixin Zhang, Zhengzhong TuVision-Language ModelsIn-Context Learning

  13. GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving

    Nov 14, 2025Fabian Schmidt, Markus Enzweiler, Abhinav ValadaVision-Language ModelsVLMs for Autonomous Driving

  14. TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models

    Sep 29, 2025Zhifang Zhang, Qiqi Tao, Jiaqi Lv +3VLM RobustnessAdversarial Attacks on VLMs

  15. HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

    Sep 26, 2025Zhen-Hao Xie, Yan Wang, Lan Li +3Class-Incremental LearningVision-Language Models

  16. TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

    Aug 11, 2025Chaohong Guo, Xun Mo, Yongwei Nie +3Temporal Video GroundingVision-Language Models

  17. SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models

    Aug 5, 2025Yufei Xue, Yushi Huang, Lunjie Zhu +2Vision-Language ModelsVLM Quantization

  18. LaViDa: A Large Diffusion Language Model for Multimodal Understanding

    May 22, 2025Shufan Li, Konstantinos Kallidromitis, Hritik Bansal +7Vision-Language ModelsEfficient VLM Inference

  19. Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models

    May 18, 2025Kai Tang, Jinhao You, Yichen Guo +8Vision-Language ModelsHallucination in Language Models

  20. Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

    Mar 17, 2025Ruichuan An, Kai Zeng, Ming Lu +5Synthetic Data AugmentationVision-Language Models

  21. REVEAL: Robust Evolution of Vision-Language Models for Explainable AI-Video Detection

    Feb 20, 2025Yun-Yun Tsai, Qingyuan Liu, Ruijian Zha +4Tool Use in VLMsVision-Language Models

  22. Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking

    Dec 30, 2024Sangyun Chung, Youngjoon Yu, Se Yeon Kim +2VLM EvaluationVision-Language Models

  23. VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

    Oct 1, 2024Junlin Fang, Wenyu Chen, Reshmi Ghosh +7VLM RobustnessVision-Language Models

  24. Prompting with Sign Parameters for Low-resource Sign Language Instruction Generation

    Date pendingMd Tariquzzaman, Md Farhan Ishmam, Saiyma Sittul Muna +2VLM EvaluationVision-Language Models

  25. CLIP-RD: Relational Distillation for Efficient CLIP Knowledge Distillation

    Date pendingJeannie Chung, Hanna Jang, Ingyeong Yang +2Cross-Modal LearningCross-Modal Knowledge Distillation

  26. TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

    Date pendingPeng Cai, Zhaofan Zou, Shifa Liu +7Vision-Language ModelsDocument Parsing

  27. StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

    Date pendingJoya Chen, Zeyun Zhong, Mike Zheng ShouMemory-Augmented VLMsStreaming Video Understanding