VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods

    Sep 1, 2026Mehrdad Fazli, Sina Mansouri, Mohit Marvania +1VLM EvaluationFaithfulness in VLMs

  2. MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models

    Sep 1, 2026Tawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir +5VLM EvaluationMultilingual VLM Evaluation

  3. FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making

    Sep 1, 2026Vahid Reza Khazaie, Ahmed Y. Radwan, Shaina RazaVLM Evaluation

  4. InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations

    Sep 1, 2026Maeve Hutchinson, Syed Mahbubul Huq, Mohammad Albinhassan +3VLM EvaluationClaim Verification

  5. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals

    Sep 1, 2026Md. Atabuzzaman, Christian Alexander, Chris ThomasVLM EvaluationLarge Vision-Language Models

  6. Reliability Challenges in Diffusion Vision-Language Models

    Sep 1, 2026Md. Atabuzzaman, Chris ThomasVLM EvaluationVLM Robustness

  7. A multicenter benchmark and clinically structured metric for coronary CTA report generation

    Sep 1, 2026Zhiyu Ye, Yue Sun, Limiao Zou +7VLM EvaluationRadiology Report Generation

  8. Visual Attention Faithfulness in Vision-Language Models is Heterogeneous

    Sep 1, 2026Xurui Song, Weishi Wang, Zhongqi Yue +5VLM EvaluationVisual Question Answering

  9. Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures

    Sep 1, 2026Can Polat, Mustafa Kurban, Erchin Serpedin +1VLM EvaluationVLM Reasoning

  10. Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

    Aug 31, 2026Yue Zhou, Yuan Wu, Yi ChangVLM EvaluationLarge Vision-Language Models

  11. Good Memory Has ECC: Evaluating the Memory of Vision-Language Models Beyond Accuracy

    Aug 31, 2026Shmuel Berman, Jia DengVLM EvaluationMemory-Augmented VLMs

  12. Do VLMs Share Safety Neurons Across Modalities?

    Aug 31, 2026Jiaxuan Li, Jiahao Zhang, Duc Minh Vo +3VLM EvaluationVLM Interpretability

  13. Fine-Grained Multi Image Object Hallucination Benchmark

    Aug 31, 2026Joonki Min, Chaeyun Kim, Hyungwook Choi +4VLM EvaluationObject Hallucination in VLMs

  14. Lot Machine: Multimodal Lot Extraction from Auction Catalogs

    Aug 31, 2026Mathias Zinnen, Alisha Mund, Sabine Lang +3VLM EvaluationDocument Image Understanding

  15. Frontier vision-language models have overtaken young adults at detecting AI-generated portraits -- but not their calibration

    Aug 31, 2026Sunwhi Kim, Sunyul Kim, Meounggun Jo +1VLM EvaluationVision-Language Models

  16. Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

    Aug 30, 2026Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan +3VLM EvaluationVLM Unlearning

  17. MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

    Aug 27, 2026Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan +6VLM EvaluationVLM Robustness

  18. Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

    Aug 26, 2026Luca Bux, Thiago Rios, Ingo Scholtes +2VLM EvaluationVision-Language Models

  19. When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

    Aug 25, 2026Zhengxiang Wang, Owen RambowVLM EvaluationLarge Vision-Language Models

  20. How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

    Aug 13, 2026Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee +4VLM EvaluationVLM Robustness

  21. TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

    Aug 13, 2026Fnu Pramono, John Cai, Sourabh KulkarniVLM EvaluationVision-Language Models

  22. Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

    Aug 12, 2026Vladyslava Rudas, Dmytro KuzmenkoVLM EvaluationRobot Safety

  23. How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

    Aug 12, 2026Guang Yang, Fengchen Liu, Alex Wang +2VLM EvaluationRefusal Behavior in Language Models

  24. JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

    Aug 12, 2026Ran Li, Huiguo He, Jiahuan Cao +3VLM EvaluationVLM Reasoning

  25. VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

    Aug 11, 2026Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute +1VLM EvaluationUnderwater Image Enhancement