Medical VLMs

VLM: Vision-Language Model

Momentum

22 papers in the last four weeks, up 22% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 266

All topics
CardsList
  1. AlphaRAD: Grounded Zero-Shot Classification in Chest Radiology via αα-Corrected Binary Cross Entropy and Factorized Latent Supervision

    Sep 1, 2026Jianzhong You, Yuan Gao, Chris McIntoshChest X-Ray ClassificationMedical Image Classification

  2. BrainDiff: Longitudinal Report Generation for Multimodal Brain MRI

    Sep 1, 2026Krish Patel, Peirong LiuRadiology Report GenerationLongitudinal Medical Image Analysis

  3. MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

    Aug 27, 2026Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan +6VLM EvaluationVLM Robustness

  4. HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation

    Aug 13, 2026Yunhao Bai, Zhongwei Qiu, Guangyu Guo +5Medical Report GenerationWorld Model Learning

  5. Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP

    Aug 12, 2026Nikolette Pedersen, Regitze Sydendal, Veronika Cheplygina +1Chest X-Ray ClassificationMedical VLMs

  6. CARE: Confidence-Aware Reasoning for Reliable Medical VQA

    Aug 11, 2026Yuetian Du, Yucheng Wang, Zhenyuan Chen +9Medical VQAMedical VLMs

  7. MIRA: Medical Image Reflection for Agentic Diagnosis

    Aug 11, 2026Shengzhi Wang, Jun Yang, Kai Wu +11Medical Image AnalysisLLM Agent Verification

  8. MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

    Aug 11, 2026Yuan Wang, Hualiang Wang, Yixin Chen +6Unified Multimodal ModelsVision-Language Grounding

  9. Towards Expert-level Medical AI for Real-time Video Consultations

    Aug 10, 2026Mahvish Nagda, Jihyeon Lee, Matthew Thompson +37Audio-Visual UnderstandingMedical VLMs

  10. MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

    Aug 10, 2026Haoyu Yang, Meixing Shi, Zengjie Chen +5Medical VLMsVLM Reasoning

  11. Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

    Aug 10, 2026Jun Huang, Meiyi Chen, Zijie Yue +6Text-Guided Image SegmentationMedical VLMs

  12. Diagnosing as Cardiologists Do: ECG Agents with Doctor-Grounded Priors for Clinical Reasoning Across Diseases and Populations

    Aug 10, 2026Hongxiang Gao, He-yang Xu, Yuwen Li +6ElectrocardiographyElectrocardiogram Classification

  13. An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

    Aug 7, 2026Jalil Jalili, Hossein Taghizad, Anuwat Jiravarnsirikul +8Medical ImagingMedical Image Classification

  14. DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation

    Aug 6, 2026Jiaxuan Li, Qing Xu, Xiangjian He +4Cross-Modality Medical Image SegmentationMedical VLMs

  15. Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

    Aug 5, 2026Zach Eidex, Yu-nong Lin, Mojtaba Safari +4Interactive Medical Image SegmentationMedical Imaging Foundation Models

  16. Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

    Aug 5, 2026Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian +1VLM EvaluationVLM Robustness

  17. EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

    Aug 5, 2026Zhenyu Yi, Jianwei Xu, Yue Hu +6Medical Imaging Foundation ModelsMedical VLMs

  18. LocAnyMed: Vision-Language Grounding for Multimodal Medical Images

    Aug 4, 2026Zihan Wang, Tong Liu, Zhiwei Wang +6Medical VLMsMedical Image Grounding

  19. Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

    Aug 4, 2026Chengyu Wu, Junpeng Tan, Wanxiang Luo +3Concept Bottleneck ModelsMedical Diagnosis

  20. NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

    Aug 4, 2026Yantong Liu, Zheyu Zhang, Runpeng Liu +3Multimodal Large Language ModelsMedical VLMs

  21. Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

    Aug 3, 2026Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey PlisVLM EvaluationVLM Hallucination

  22. Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions

    Aug 1, 2026Pengyang Yu, Yiou Wang, Zhongping Dong +3Chest X-Ray ClassificationMedical VLMs

  23. ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

    Jul 31, 2026Renjie Liang, Zijian Xu, Jinqian Pan +6Medical VLMsVisual Token Merging

  24. Semantically Calibrated Evidence Composition for CT Vision-Language Learning

    Jul 31, 2026Guoliang You, Haifan Gong, Xiaomeng ChuMedical VLMsMedical Image Grounding

  25. Real-Time Visual Obstruction Detection in Surgical Augmented Reality

    Jul 31, 2026Shih-Chin Yang, Yanming Xiu, Hanting Ye +3Efficient InferenceMedical VLMs

  26. Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining

    Jul 31, 2026Guoliang You, Haifan Gong, Xiaomeng ChuRepresentation LearningMedical Image Analysis