Medical VLMs

VLM: Vision-Language Model

Momentum

22 papers in the last four weeks, up 22% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 266

All topics
CardsList
  1. OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

    Jun 10, 2026Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci +6Medical VQAMedical VLMs

  2. FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

    Jun 9, 2026Mahmood Alzubaidi, Uzair Shah, Raden Muaz +6Ultrasound Image SegmentationSelective Knowledge Distillation

  3. MAGIS: Evidence-Based Multi-Agent Reasoning for Interpretable Strabismus Clinical Decision-Making

    Jun 8, 2026Xikai Tang, Yifan Wang, Jiafan Zhuang +12Medical DiagnosisMedical VLMs

  4. Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning

    Jun 7, 2026Jingzhi Chen, Landi He, Zhuo Chen +2Efficient VLM InferenceMedical VLMs

  5. MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models

    Jun 4, 2026Aofei Chang, Le Huang, Alex James Boyd +4Medical VLMsMedical Image Segmentation

  6. MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

    Jun 4, 2026Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun +17Medical Image AnalysisMedical VLMs

  7. EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

    Jun 4, 2026Hao Wang, Qiwei Zeng, Jinghao Lin +6VLM AdaptationMedical Image Anomaly Detection

  8. Noise-Aware Visual Representation Learning for Medical Visual Question Answering

    Jun 4, 2026I Putu Adi Pratama, Bahadorreza Ofoghi, Atul Sajjanhar +1VLM RobustnessDenoising Autoencoders

  9. Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models

    Jun 3, 2026Tran Dinh Tien, Zhiqiang ShenVLM AdaptationVLM Distillation

  10. BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

    Jun 3, 2026Yang Liu, Jiajin Zhang, Danyang Tu +8Breast CancerMedical Imaging

  11. Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

    Jun 3, 2026Alessandro Gambetti, Qiwei Han, Cláudia Soares +1VLM EvaluationModality Imbalance

  12. Large AI Models in Dental Healthcare: From General-Purpose Systems to Domain-Specific Foundation Models

    Jun 1, 2026Sema Helali, Lina Abu Nada, Sausan Al Kawas +3Medical Imaging Foundation ModelsMedical VLMs

  13. Cross-modal linkage risk in clinical vision-language models

    Jun 1, 2026Soroosh Tayebi Arasteh, Mahshad Lotfinia, Sven Nebelung +1Medical VLMsPrivacy Protection in VLMs

  14. Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

    May 31, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +10Vision-Language ModelsMultimodal Pretraining

  15. Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

    May 30, 2026Yeqi Huang, Yue Chen, Yanwei Ye +2VLM AdaptationSynthetic Data Generation

  16. ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training

    May 30, 2026Rongsheng Wang, Fenghe Tang, Zihang Jiang +10Medical VLMsMedical Image Grounding

  17. Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

    May 29, 2026Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh +1Computational PathologyMedical Report Generation

  18. CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

    May 28, 2026Zixian Su, Hongkai Zhang, Fan Gao +12Magnetic Resonance ImagingMedical VLMs

  19. Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

    May 28, 2026Kai Bian, Xucheng Guo, Bin Chen +4Medical ImagingEfficient VLM Inference

  20. VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs

    May 27, 2026Qiaoru Li, Shaotian Liang, Jintao Chen +4Medical VQAVLM Interpretability

  21. OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Xiwen Chen +13Medical Image AnalysisMedical VQA

  22. Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

    May 26, 2026Ning Wu, Rui Liu, Xinkun Lin +5Medical Report GenerationLong-Form Document Generation

  23. MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation

    May 26, 2026Zichun Wang, Hairong Shi, Bingzheng Wei +2Image SegmentationReinforcement Learning

  24. BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma

    May 25, 2026Junlin Yang, Tian Yu, Nicha C. Dvornek +6Radiology VLMsCancer Survival Prediction

  25. CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection

    May 25, 2026Durjoy Dey, Yuhong Yan, Hassan HajjdiabHybrid CNN-Transformer ArchitecturesVision Transformer

  26. Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening

    May 25, 2026Durjoy Dey, Aymane Ajbar, Yuhong YanHybrid CNN-Transformer ArchitecturesVision Transformer

  27. RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

    May 25, 2026Sofiat Abioye, Ufaq Khan, Shazad Ashraf +4Document UnderstandingHealthcare

  28. Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models

    May 24, 2026Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois +7Radiology Report GenerationHealthcare

  29. Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

    May 24, 2026Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa +1EndoscopyMedical Imaging

  30. From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks

    May 23, 2026Bruce Changlong Xu, Jose James, Alexander RyuVision-Language ModelsMedical Image Classification