Medical VLMs

VLM: Vision-Language Model

Momentum

22 papers in the last four weeks, up 22% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 266

All topics
CardsList
  1. MedBenchAgent: Towards Systematic Automation of Medical VLM Benchmark Construction

    Oct 8, 2026Yulin Fu, Junren Wang, Guangjing Yang +5Medical Image BenchmarksVLM Evaluation

  2. ΔΔRepresentation: Geometry Supervised Representation Learning of Phenotypes via Counterfactual Reasoning for Medical VLMs

    Oct 7, 2026Hao Wang, Qiwei Zeng, Jinghao Lin +6Medical Image Representation LearningMedical VLMs

  3. A Deterministic Evidence Layer for Vision-Language Autism Screening from Naturalistic Home Video

    Oct 6, 2026Wenqi Li, Mindi Ruan, Chuanbo Hu +2Autism Spectrum DisorderMedical VLMs

  4. MedCORE: Criteria-Grounded Clinical Reasoning for Interpretable Medical Image Diagnosis

    Oct 6, 2026Asim Khan, Samee Ullah Khan, Dwarikanath MahapatraMedical Image ClassificationMedical VLMs

  5. A doctrine-grounded visual question answering dataset for Tactical Combat Casualty Care

    Oct 5, 2026Junseob Kim, Jade Chng, Ayman Ali +5Medical VQAVideo QA

  6. Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

    Sep 30, 2026Tian Xia, Minghao Liu, Yiqing Liang +2Medical DiagnosisMultimodal Large Language Models

  7. GateSPINE: Gated Cross-View Fusion for Lumbar Spine MRI Report Generation

    Sep 30, 2026Hoang Nguyen Van, Cuong Vuong Tuan, Trang Mai Xuan +3Radiology Report GenerationMagnetic Resonance Imaging

  8. From Given to Gathered Evidence: Agentic Learning for Longitudinal Medical Reasoning

    Sep 30, 2026Minye Shao, Chaohui Yu, Yixuan Wu +3AI Agent BenchmarksMedical VLMs

  9. OmniMed-Jev: Calibrating LVLM Confidence for Trustworthy Medical Multimodal Decisions via System One

    Sep 30, 2026Luyao Tang, Cheng ChenProbability CalibrationMultimodal Classification

  10. CRAFT: Causal Responsibility and Failure Tracing in Medical Vision Language Models

    Sep 30, 2026Chunzheng Zhu, Jiaqi Zeng, Hongbo Zhao +3Vision-Language ModelsMedical VQA

  11. How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective

    Sep 29, 2026Janet Wang, Yunbei Zhang, Xiao Wang +1Medical DiagnosisVLM Interpretability

  12. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  13. VL-AcneSeg: A Vision-Language Framework for Region-Aware Acne Lesion Segmentation

    Sep 28, 2026Sukju Oh, Soo Ick Cho, Dae Hun Suh +1Text-Guided Image SegmentationMedical VLMs

  14. Clinical Trajectory Alignment for Medical Vision-Language Pre-training

    Sep 28, 2026Huimin Yan, Xian Yang, Zhi Wang +1Multimodal PretrainingLongitudinal Medical Image Analysis

  15. See, Measure, and Reason: Learning Visually Grounded Reasoning in Pathology

    Sep 28, 2026Chengyang Zhang, Wenchuan Zhang, Bo Li +8Computational PathologyMedical VQA

  16. Prompt-Anchored Residual Adaptation for Biomedical Vision-Language Models

    Sep 27, 2026Jingxuan Kang, Qianying Yue, Che Liu +1VLM AdaptationFew-Shot Learning

  17. FFM-CP: Cross-Backbone Fusion of Vision-Language Foundation Models for Few-Shot Computational Pathology

    Sep 23, 2026Anh-Tien Nguyen, Trung DQ. Dang, Nghiem Tuong Diep +9Computational PathologyFew-Shot Learning

  18. Benchmarking Off-the-Shelf Multimodal AI Models Against Dermatologists on Patient-Captured Skin Images

    Sep 21, 2026Rian Dolphin, Laura KnowlesSkin Lesion ClassificationMedical VLMs

  19. A Vision-Language Foundation Model for Precise and Comprehensive Brain Tumor Diagnosis from Preoperative Multimodal Data

    Sep 15, 2026Yinong Wang, Jianwen Chen, Zhou Chen +28Medical VLMsBrain Tumor Classification

  20. A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion Segmentation

    Sep 14, 2026Yang Xing, Jiong Wu, Savas Ozdemir +11Radiology Report GenerationMedical VQA

  21. Option-Aware Retrieval and Task-Specific VLM Adaptation for Medical VQA

    Sep 14, 2026Tristan Kirscher, Niklas C. Koser, Soren PirkVLM AdaptationMultiple-Choice Question Answering

  22. Rethinking Correctness for Uncertainty Estimation in Clinical Prediction with Vision-Language Models

    Sep 14, 2026Mingcheng Zhu, Jinning Liang, Tingting ZhuUncertainty QuantificationMedical VLMs

  23. Bridging Vision Foundation Model Priors with CLIP for Spatial-aware Few-shot Anomaly Detection in Medical Images

    Sep 14, 2026Juzheng Miao, Yuchen Yuan, Cheng Chen +1Few-Shot Anomaly DetectionMedical Image Anomaly Detection

  24. Layer Selection in VLMs for Zero-Shot OOD Detection via Multi-Resolution Entropy Estimation

    Sep 8, 2026Shyam Nandan Rai, Francesco Di Salvo, Sebastian Doerrich +1Vision-Language ModelsMedical VLMs

  25. A visual large language foundational model for medical image recognition using clinician-contributed online resources

    Sep 7, 2026Lingxuan Hou, Yuhua Xie, Yue Hu +14Medical VQAMedical VLMs

  26. MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT

    Sep 3, 2026Chenguang Zheng, Le Xue, Yichi Zhang +8PET/CT ImagingMedical VLMs

  27. Federated LoRA Adaptation of BiomedCLIP Across Four International Chest X-Ray Cohorts

    Sep 2, 2026Sanjaya Poudel, Nirajan Kunwor, Manish Dhakal +2Federated Fine-TuningFederated Learning