VLM Robustness

VLM: Vision-Language Model

Latest papers 295

All topics
CardsList
  1. Test-Time Training for Robust Text-Guided Open-Vocabulary Object Counting

    Jun 16, 2026Hao-Yuan Ma, Yuda Zou, Li Zhang +1VLM RobustnessImage Corruption Robustness

  2. Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

    Jun 16, 2026Logan Mann, Yi Xia, Ajit Saravanan +6VLM EvaluationVLM Robustness

  3. Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

    Jun 15, 2026Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna +2VLM EvaluationVLM Robustness

  4. VISTA: View-Consistent Self-Verified Training for GUI Grounding

    Jun 12, 2026Xinyu Qiu, Yunzhu Zhang, Heng Jia +3Multi-View ConsistencyVLM Robustness

  5. When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

    Jun 12, 2026Yinfeng Wang, Zhiyuan Yao, Zheren Fu +2VLM RobustnessMultimodal Large Language Models

  6. Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

    Jun 11, 2026Shenglai Zeng, Qirui Wang, Kai Guo +3VLM RobustnessVisual Attention

  7. Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

    Jun 10, 2026Everett RichardsVLM EvaluationVLM Robustness

  8. LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

    Jun 9, 2026Taishan Li, Jiwen Zhang, Siyuan Wang +2VLM RobustnessRobotic Manipulation

  9. ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models

    Jun 8, 2026Fan Zhang, Seongbin Park, Baharan Mirzasoleiman +2VLM RobustnessRobot Failure Recovery

  10. Scaling by Diversified Experience for Vision-Language-Action Models

    Jun 8, 2026Leiyu Wang, Zhaofengnian Wang, Xueqi Li +3VLM RobustnessVision-Language-Action Models

  11. Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

    Jun 8, 2026Yizheng Sun, Mochuan Zhan, Yanan Ma +10VLM EvaluationVLM Robustness

  12. How Many Counterfactuals Does It Take? Probing VLM Hallucinations Through Circuits and Causal Effects

    Jun 7, 2026Abhivansh Gupta, Simardeep Singh, Advika Sinha +2Hallucination Detection in VLMsVLM Robustness

  13. Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

    Jun 6, 2026Jiaqi Tang, Jianmin Chen, Youyang Zhai +6VLM RobustnessImage Corruption Robustness

  14. Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

    Jun 6, 2026Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra +3VLM EvaluationVLM Robustness

  15. MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

    Jun 5, 2026Rishabh Makwana, Mamta, Deeksha Varshney +1VLM EvaluationVLM Robustness

  16. SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

    Jun 5, 2026Sunoh Kim, Daeho UmVLM RobustnessVLM Adaptation

  17. When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness

    Jun 5, 2026Sunoh Kim, Daeho UmVLM RobustnessAdversarial Attacks

  18. Diagnosing Visual Ignorance in Vision-Language Models

    Jun 5, 2026Runyu Zhou, Qi Zhang, Yisen WangVLM EvaluationVLM Robustness

  19. Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

    Jun 4, 2026Liangsheng Liu, Si Chen, Jiamin Wu +5VLM RobustnessAdversarial Attacks on VLMs

  20. Noise-Aware Visual Representation Learning for Medical Visual Question Answering

    Jun 4, 2026I Putu Adi Pratama, Bahadorreza Ofoghi, Atul Sajjanhar +1VLM RobustnessDenoising Autoencoders

  21. Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanVLM RobustnessAdversarial Robustness

  22. Investigating Adversarial Robustness of Multi-modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingVLM Robustness

  23. Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

    Jun 2, 2026Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto YudistiraVLM EvaluationVLM Robustness

  24. Partially Observable Adversarial Patch Attacks on Vision-Language-Action Models in Robotics

    Jun 2, 2026Xiaofei Wang, Mingliang Han, Tianyu Hao +3VLM RobustnessAdversarial Patch Attacks

  25. P2^2-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

    Jun 2, 2026Ruipeng Zhang, Zhihao Li, Haozhang Yuan +2VLM RobustnessDirect Preference Optimization

  26. BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

    Jun 1, 2026Ivan Sabolić, Marin Oršić, Josip Šarić +1Supervised Fine-TuningVLM Robustness

  27. Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

    Jun 1, 2026S Divakar Bhat, Toshihiko YamasakiVLM EvaluationMulti-View Consistency