VLM Interpretability

VLM: Vision-Language Model

Momentum

24 papers in the last four weeks, up 200% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 158

All topics
CardsList
  1. TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

    Aug 13, 2026Fnu Pramono, John Cai, Sourabh KulkarniVLM EvaluationVision-Language Models

  2. Where To Look? : Causal Tracing of Vision Encoders in VLM

    Aug 11, 2026Naren Kumar S, Tirth Bhatt, Mayank SinghLarge Vision-Language ModelsVLM Interpretability

  3. From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

    Aug 9, 2026Alexander Hackett, Arnaud Denis-Remillard, Axel CassouVLM InterpretabilityVision-Language-Action Models

  4. Attention is Case-Sensitive

    Aug 4, 2026Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso +1LLM InterpretabilityVLM Interpretability

  5. Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

    Aug 2, 2026Nafis Fuad, Xiaodong Qian, Dongxiao ZhuVLM AdaptationDepth Estimation

  6. Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

    Aug 1, 2026Shalom Kachko, Raz Lapid, Margarita Vald +2Vision-Language ModelsVLM Interpretability

  7. DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

    Aug 1, 2026An Lanji, Dawei Liu, Jin Li +3AI Agent ReliabilityVLM Interpretability

  8. Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

    Jul 29, 2026Piyush Jain, Kousik Dasgupta, Rajarshi Roy +1Visual Spatial Reasoning3D Spatial Reasoning

  9. Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

    Jul 25, 2026Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski +1VLM InterpretabilityShapley Value Attribution

  10. Sparse Concept Channels in Frozen 3D CT Vision Encoders

    Jul 23, 2026Farhad Nooralahzadeh, Lea Bogensperger, Christian Bluethgen +1Radiology Report Generation3D Medical Imaging

  11. Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

    Jul 20, 2026Binesh Sadanandan, Vahid BehzadanVLM EvaluationVLM Interpretability

  12. Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

    Jul 17, 2026Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava MadhyasthaData VisualizationVisual Attention

  13. How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

    Jul 17, 2026Navya Gupta, Bingjie Xu, Avinash Anand +2Visual Question AnsweringVLM Interpretability

  14. What Keeps Vision-Language Models Looking at the Image?

    Jul 14, 2026Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi +3Vision-Language ModelsVLM Interpretability

  15. The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

    Jul 13, 2026Wencheng Ye, Yi Bin, Yujuan Ding +7VLM InterpretabilityMultimodal Reasoning

  16. Mixture of Cognitive Experts in Large Vision-Language Models

    Jul 12, 2026Robert Wijaya, Ngai-Man CheungVision-Language ModelsLarge Vision-Language Models

  17. The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

    Jul 10, 2026Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh +2Vision-Language ModelsVLM Interpretability

  18. When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

    Jul 9, 2026Weiduo Liao, Yunqiao Yang, Ying WeiVLM InterpretabilitySparse Autoencoders

  19. A Good Initialization is All You Need for Faithful Visual Attribution

    Jul 7, 2026Zihan Gu, Jiayu Wang, Hua Zhang +1Feature AttributionPerturbation-Based Feature Attribution

  20. Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

    Jul 7, 2026Yoav Baron, Sara Dorfman, Roni Paiss +2Visual Place RecognitionVLM Interpretability

  21. Pathways of Visual Information Flow in Vision-Language Models

    Jul 3, 2026Israfel Salazar, Stella Frank, Dan Oneata +2Vision-Language ModelsVLM Interpretability