Medical VLMs

VLM: Vision-Language Model

Momentum

22 papers in the last four weeks, up 22% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 266

All topics
CardsList
  1. Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

    Mar 21, 2026Huan Zheng, Yucheng Zhou, Tianyi Yan +6EndoscopyMedical Diagnosis

  2. HiPath: Hierarchical Vision-Language Alignment for Structured Pathology Report Prediction

    Mar 20, 2026Ruicheng Yuan, Zhenxuan Zhang, Anbang Wang +5Computational PathologyMedical Report Generation

  3. Medical Image Spatial Grounding with Semantic Sampling

    Mar 15, 2026Andrew Seohwan Yu, Mohsen Hariri, Kunio Nakamura +3Medical VLMsMedical Image Grounding

  4. MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models

    Mar 12, 2026Shengyuan Liu, Zanting Ye, Yunrui Lin +6Efficient VLM Inference3D Medical Imaging

  5. MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

    Mar 1, 2026Kai Zhang, Zhengqing Yuan, Cheng Peng +10HealthcareMultimodal Pretraining

  6. PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM

    Feb 26, 2026Yiqing Wang, Chunming He, Ming-Chen Lu +4Cross-Modal AlignmentMultimodal Pretraining

  7. BiCLIP: Bidirectional and Consistent Language-Image Processing for Robust Medical Image Segmentation

    Feb 25, 2026Saivan Talaei, Fatemeh Daneshfar, Abdulhady Abas Abdullah +1Multimodal RobustnessMedical VLMs

  8. CytoCLIP: Learning Cytoarchitectural Characteristics in Developing Human Brain Using Contrastive Language Image Pre-Training

    Jan 18, 2026Pralaypati Ta, Sriram Venkatesaperumal, Keerthi Ram +1Medical VLMsHistopathology Image Classification

  9. MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

    Jan 14, 2026Yang Xing, Jiong Wu, Savas Ozdemir +4Interactive Medical Image SegmentationUnified Multimodal Models

  10. M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

    Jan 13, 2026Juntao Jiang, Jiangning Zhang, Yali Bi +7Medical VLMsMultimodal CoT Reasoning

  11. A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding

    Dec 24, 2025Christina Liu, Alan Q. Wang, Joy Hsu +2Tool Use in VLMsMedical Image Classification

  12. PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

    Dec 19, 2025Fengchun Liu, Songhan Jiang, Linghan Cai +2Computational PathologyVision-Language Grounding

  13. Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

    Dec 16, 2025Yankai Jiang, Yujie Zhang, Peng Zhang +5Image SegmentationTool Use in VLMs

  14. 6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models

    Dec 3, 2025Leon Mayer, Piotr Kalinowski, Caroline Ebersbach +6VLM EvaluationVLM Robustness

  15. Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

    Nov 18, 2025Zehao Liu, Weijieying Ren, Jipeng Zhang +4VLM RobustnessMedical Diagnosis

  16. Cross-Task Generalization in Handwriting-Based Alzheimer's Screening via Vision Language Adaptation

    Nov 8, 2025Changqing Gong, Huafeng Qin, Mounim A. El-YacoubiAlzheimer's DiseaseVLM Adaptation

  17. RAU: Reference-based Anatomical Understanding with Vision Language Models

    Sep 26, 2025Yiwei Li, Yikang Liu, Jiaqi Guo +7Image SegmentationMedical VLMs

  18. Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning

    Aug 22, 2025Ruiqi Wu, Yuang Yao, Na Su +11Medical Image AnalysisMultimodal Reasoning

  19. NEARL: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding

    Aug 6, 2025Zelin Peng, Yichen Zhao, Yu Huang +5Cross-Modal LearningVLM Adaptation

  20. SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

    May 16, 2025Jiajun Cheng, Xianwu Zhao, Sainan Liu +5VLM EvaluationSurgical Video Understanding

  21. Synergistic Vision-Language Reinforcement Enables Scalable On-Demand Analysis across Diverse Clinical Tasks

    May 6, 2025Haonan Wang, Jiaji Mao, Lehan Wang +11Image SegmentationMedical Imaging Foundation Models

  22. A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI

    Mar 26, 2025Alejandro Lozano, Min Woo Sun, James Burgess +16Medical VLMs

  23. Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?

    Date pendingXin Chen, Dongliang Xu, Cunhao Zhu +5Medical VLMsMedical Image Benchmarks

  24. Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

    Date pendingGuiqiu Liao, Matjaz Jogan, Daniel A. HashimotoImage TokenizationHealthcare