VLM Robustness

VLM: Vision-Language Model

Latest papers 295

All topics
CardsList
  1. Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues

    Apr 27, 2026Beomchan Park, Seongho Kim, Hyunjun Kim +2VLM RobustnessLLM Grounding

  2. From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification

    Apr 24, 2026Aotian Zheng, Winston Sun, Bahaa Alattar +2VLM RobustnessPerson Re-Identification

  3. Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection

    Apr 23, 2026Wenxuan Bao, Yanjun Zhao, Xiyuan Yang +1VLM RobustnessTest-Time Adaptation

  4. Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

    Apr 23, 2026Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand +1VLM EvaluationVLM Robustness

  5. Latent Denoising Improves Visual Alignment in Large Multimodal Models

    Apr 23, 2026Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan +1VLM RobustnessMultimodal Large Language Models

  6. How VLAs (Really) Work In Open-World Environments

    Apr 23, 2026Amir Rasouli, Yangzheng Wu, Zhiyuan Li +4VLM RobustnessLong-Horizon Robotic Manipulation

  7. If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

    Apr 21, 2026Jiamin Chang, Minhui Xue, Ruoxi Sun +3VLM RobustnessAdversarial Attacks on VLMs

  8. Hierarchically Robust Zero-shot Vision-language Models

    Apr 20, 2026Junhao Dong, Yifei Zhang, Hao Zhu +2Hierarchical ClassificationVLM Robustness

  9. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  10. ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification

    Apr 20, 2026Florian Kittler, Sheethal Bhat, Andreas MaierVLM RobustnessChest X-Ray Classification

  11. OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation

    Apr 20, 2026Kuanning Wang, Ke Fan, Chenhao Qiu +5VLM RobustnessFlow Matching

  12. Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

    Apr 20, 2026Ziyao Tang, Pengkun Jiao, Bin Zhu +3VLM EvaluationVLM Robustness

  13. When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

    Apr 19, 2026Akash Ghosh, Subhadip Baidya, Sriparna Saha +1VLM RobustnessAdversarial Attacks on VLMs

  14. RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

    Apr 19, 2026Rui Min, Liang Yao, Shiyu Miao +5Remote Sensing Image UnderstandingVLM Robustness

  15. Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

    Apr 19, 2026Lijie ZhouCross-Modal LearningVLM Robustness

  16. Prompt Sensitivity in Vision-Language Grounding: How Small Changes in Wording Affect Object Detection

    Apr 18, 2026Dawar Jyoti Deka, Amit Sethi, Syed Mohammad AliOpen-Vocabulary Object DetectionVLM Robustness

  17. Information Router for Mitigating Modality Dominance in Vision-Language Models

    Apr 17, 2026Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegibVLM RobustnessVision-Language Models

  18. Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

    Apr 14, 2026Jungwon Choi, Eunwoo KimVLM RobustnessVLM Adaptation

  19. E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

    Apr 6, 2026Jiajun Zhai, Hao Shi, Shangwei Guo +2Event-Based VisionVLM Robustness

  20. TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

    Mar 31, 2026Qiucheng Yu, Ruijie Xu, Mingang Chen +2VLM EvaluationVLM Robustness

  21. Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

    Mar 30, 2026Yanjie Zhang, Yafei Li, Rui Sheng +5VLM RobustnessChart QA

  22. Can VLMs Reason Robustly? A Neuro-Symbolic Investigation

    Mar 25, 2026Weixin Chen, Antonio Vergari, Han ZhaoVLM RobustnessVisual Reasoning

  23. StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models

    Mar 21, 2026Kartikay Milind Pangaonkar, Prabin Rath, Omkar Patil +1VLM RobustnessRobotic Manipulation

  24. Visual Prompt Discovery via Semantic Exploration

    Mar 17, 2026Jaechang Kim, Yotaro Shimose, Zhao Wang +3VLM Robustness

  25. Are Video Reasoning Models Ready to Go Outside?

    Mar 11, 2026Yangfan He, Changgyu Boo, Jaehong YoonVLM RobustnessVideo Reasoning

  26. ProtoDCS: Towards Robust and Efficient Open-Set Test-Time Adaptation for Vision-Language Models

    Feb 27, 2026Wei Luo, Yangfan Ou, Jin Deng +4VLM RobustnessTest-Time Adaptation

  27. When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs

    Feb 19, 2026Yu Fang, Yuchun Feng, Dong Jing +5VLM RobustnessCounterfactual Evaluation of VLMs