Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

    Jul 2, 2026Zhenqi He, Ziqi Jiang, Yuanpei Liu +3Vision-Language ModelsComposed Image Retrieval

  2. SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

    Jul 2, 2026Qi Lyu, Jiahua Dong, Baichen Liu +7Model CompressionVision-Language Models

  3. Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

    Jul 1, 2026Yiqian Liu, Iuliia Kotseruba, John K. TsotsosVLM EvaluationVision-Language Models

  4. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  5. AdaBoosting Text Prompts for Vision-Language Models

    Jul 1, 2026Seokhee Jin, Changhwan Sung, Sunung Mun +2Vision-Language ModelsEnsemble Learning

  6. Caption Bottleneck Models

    Jul 1, 2026Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli +1Vision-Language ModelsConcept Bottleneck Models

  7. HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

    Jul 1, 2026Ji Ha Jang, Hayeon Kim, Chulwon Lee +2VLM RobustnessVision-Language Models

  8. From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

    Jun 29, 2026Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim +1VLM EvaluationVision-Language Models

  9. SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

    Jun 29, 2026Filippo Ruffini, Marco Salmé, Rosa Sicilia +2VLM EvaluationRadiology Report Generation

  10. FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models

    Jun 28, 2026Yichen Guo, Kai Tang, Fenglai Lin +5Vision-Language ModelsLarge Vision-Language Models

  11. Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

    Jun 28, 2026Xiao Wang, Liye Jin, Dan Xu +5Vision-Language ModelsVisual Object Tracking

  12. ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

    Jun 27, 2026Guanglong Sun, Shuang Cui, Bo Lei +6Memory-Augmented VLMsVision-Language Models

  13. MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

    Jun 26, 2026Nan Yang, Zhanwen Liu, Linfeng Zhang +4Vision-Language ModelsVLMs for Autonomous Driving

  14. From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

    Jun 24, 2026Haoxiang Sun, Tao Wang, Li Yuan +2Vision-Language ModelsMultimodal Large Language Models

  15. Data Selection Through Iterative Self-Filtering for Vision-Language Settings

    Jun 22, 2026Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss +1Vision-Language ModelsTraining Data Curation

  16. Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

    Jun 22, 2026Yu Cao, Ziquan Liu, Zhensong Zhang +3VLM EvaluationPhysical Consistency in Video Generation

  17. OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs

    Jun 21, 2026Hao Vo, Phu Loc Nguyen, Khoa Vo +7Multi-View GeometryVision-Language Models

  18. Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

    Jun 21, 2026Haodi Liu, Xinhang Yang, Kunda Yan +3Vision-Language ModelsHuman Activity Recognition

  19. The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

    Jun 19, 2026Serdar Ozsoy, Lars Doorenbos, Federico Spurio +2Temporal Action SegmentationVision-Language Models

  20. BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

    Jun 19, 2026Rithvik Jonna, Aakash Gurram, Man Namgung +2Vision-Language ModelsEmbodied Navigation

  21. FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

    Jun 19, 2026Juntong Peng, Qi Chen, Deyuan Qu +3Vision-Language ModelsVLMs for Autonomous Driving

  22. Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

    Jun 19, 2026Sergio Lanza, Jae Hee Lee, Stefan WermterVision-Language ModelsVLM Interpretability

  23. The Hidden Evolution of Disguised Visual Context inside the VLM

    Jun 18, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Vision-Language ModelsLarge Vision-Language Models