Counterfactual Evaluation of VLMs

VLM: Vision-Language Model

Latest papers 21

All topics
CardsList
  1. Do Vision Models Learn Physical Constraints or Rendering Shortcuts? A Counterfactual Benchmark for Grounded Physical Consistency

    Oct 6, 2026M. Moein Esfahani, Sepehr Salem, Mohammed Alser +1Physical ReasoningCounterfactual Evaluation of VLMs

  2. Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation

    Oct 1, 2026Yuan Huang, Zirui Song, Xiuying ChenVLM RobustnessLLM-as-a-Judge

  3. Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

    Sep 30, 2026Xia Hu, Brian Potetz, Chun-Ta Lu +6LLM EvaluationCounterfactual Evaluation of VLMs

  4. It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them

    Sep 29, 2026Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem +1VLM EvaluationFigurative Language Understanding

  5. Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

    Sep 29, 2026Zhongan Bi, Kepeng Lin, Xuanang Gao +2Counterfactual Evaluation of VLMsCredit Assignment in RL

  6. When VLMs Trust Context: Evaluating Scene Text Recognition under Misleading Context

    Sep 28, 2026Yuxing Cheng, Yuan Wu, Yi ChangVLM EvaluationCounterfactual Evaluation of VLMs

  7. Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning

    Sep 23, 2026Yeonsung Jung, Joonhyun Jeong, Hoang Pham +4VLM RobustnessCounterfactual Evaluation of VLMs

  8. LegendBench: A Diagnostic Benchmark for Legend Understanding with Counterfactual Interventions

    Sep 21, 2026Xinnuo Zhang, Zhike Tang, Jing Xu +2VLM EvaluationCounterfactual Evaluation of VLMs

  9. EDCT-Bench: Uncovering Faithfulness Gaps in VLMs via Explanation-Driven Counterfactual Testing

    Sep 16, 2026Sihao Ding, Santosh Vasa, Aditi Ramadwar +1VLM EvaluationVLM Robustness

  10. MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

    Jul 1, 2026Leyuan Yu, Xiao Tang, Minghao Liu +6VLM EvaluationSpatial Reasoning Benchmarks

  11. Ill-Posed by Design: Probing Evidence Use in VLMs

    Jun 23, 2026Boaz Meivar, Shaked Perek, Shani Shvartzman +2VLM EvaluationCounterfactual Evaluation of VLMs

  12. How Many Counterfactuals Does It Take? Probing VLM Hallucinations Through Circuits and Causal Effects

    Jun 7, 2026Abhivansh Gupta, Simardeep Singh, Advika Sinha +2Hallucination Detection in VLMsVLM Robustness

  13. Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

    May 26, 2026Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1VLM EvaluationData Visualization

  14. CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

    May 18, 2026Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid +3VLM EvaluationVision-Language Models

  15. C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

    May 11, 2026Kefei Tian, Yuansheng Lian, Kai Yang +2VLM RobustnessCounterfactual Evaluation of VLMs

  16. Cross-Cultural Value Attribution in Large Vision-Language Models

    Apr 10, 2026Phillip Howard, Xin Su, Kathleen C. FraserVLM EvaluationCounterfactual Evaluation of VLMs

  17. When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs

    Feb 19, 2026Yu Fang, Yuchun Feng, Dong Jing +5VLM RobustnessCounterfactual Evaluation of VLMs