VLM Robustness

VLM: Vision-Language Model

Latest papers 295

All topics
CardsList
  1. Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

    May 19, 2026Weicong Ni, Tianbao Jiang, Linlin WangVLM RobustnessObject Hallucination in VLMs

  2. RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding

    May 19, 2026Hanqing Liu, Mingjie Liu, Luoping Cui +3Visual Question AnsweringEvent-Based Vision

  3. Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

    May 18, 2026Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard KainzVLM RobustnessIn-Context Learning

  4. Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

    May 18, 2026Junming Liu, Yuqi Li, Yifei Sun +6VLM RobustnessVision-Language Models

  5. SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning

    May 18, 2026Xiao Yang, Ronghao Fu, Zhiwen Lin +10VLM EvaluationVLM Robustness

  6. Employing Vision-Language Models for Face Image Quality Assessment

    May 17, 2026Erdi Sarıtaş, Eren Onaran, Vitomir Štruc +1VLM EvaluationVLM Robustness

  7. Medical Context Distorts Decisions in Clinical Vision Language Models

    May 17, 2026David Restrepo, Ira Ktena, Maria Vakalopoulou +2VLM EvaluationVLM Robustness

  8. SHED: Style-Homogenized Embedding Alignment for Domain Generalization

    May 16, 2026Kai Gan, Tong WeiVLM RobustnessVLM Adaptation

  9. Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

    May 15, 2026Narges Babadi, Hadis KarimipourVLM RobustnessAdversarial Attacks on VLMs

  10. Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

    May 15, 2026Fabian Morelli, Arnas Uselis, Ankit Sonthalia +1Distribution Shift RobustnessVLM Robustness

  11. Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

    May 15, 2026Chufan Shi, Cheng Yang, Yaokang Wu +4VLM EvaluationVLM Robustness

  12. VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

    May 15, 2026Hyesoo Hong, Minsoo Kim, Wonje Jeung +3VLM EvaluationVisual Navigation

  13. AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

    May 15, 2026Zhiwei Li, Jiacheng Xue, Weining Wang +4VLM RobustnessAdversarial Robustness

  14. To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

    May 14, 2026Chengshuai Zhao, Zhen Tan, Dawei Li +2VLM RobustnessMultimodal Robustness

  15. CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding

    May 13, 2026Hanwen Zhang, Yao Liu, Die Dai +4VLM RobustnessMedical Image Anomaly Detection

  16. What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

    May 13, 2026Yuanfang Peng, Jingjing Fu, Chuheng Zhang +6VLM RobustnessDomain Generalization

  17. Revealing Interpretable Failure Modes of VLMs

    May 12, 2026Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva +2VLM RobustnessVision-Language Models

  18. GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization

    May 12, 2026Xiaosong Jia, Bowen Yang, Zuhao Ge +17VLM RobustnessRobotic Manipulation

  19. Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

    May 12, 2026Gengluo Li, Shangpin Peng, Xingyu Wan +16VLM EvaluationVLM Robustness

  20. Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement

    May 12, 2026Zhenxin Qin, Qiang Li, Qingzhuo Wang +3VLM RobustnessVLM Hallucination

  21. Dynamic Execution Commitment of Vision-Language-Action Models

    May 12, 2026Feng Chen, Xianghui Wang, Yuxuan Chen +4VLM RobustnessEfficient VLM Inference

  22. CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography

    May 11, 2026Eva Prakash, Yunhe Gao, Chong Wang +10VLM RobustnessChest X-Ray Classification

  23. C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

    May 11, 2026Kefei Tian, Yuansheng Lian, Kai Yang +2VLM RobustnessCounterfactual Evaluation of VLMs

  24. Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

    May 11, 2026Qingxin Xiao, Peilin Zhao, Yangyang Zhao +2VLM RobustnessHallucination in Language Models