Medical VLMs

VLM: Vision-Language Model

Momentum

22 papers in the last four weeks, up 22% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 266

All topics
CardsList
  1. Scientific Domain Knowledge Improves Vision-Language Fundus Models

    May 4, 2026Verena Jasmin Hallitschke, Carsten Eickhoff, Philipp BerensHealthcareMedical Diagnosis

  2. Ultrasound Vision-Language Alignment via Contrastive Learning

    May 4, 2026Zhuoyang Lyu, Yiyang Zhang, Tongxin Wang +1Cross-Modal AlignmentUltrasound Imaging

  3. Exploring Prompt Alignment with Clinical Factors in Zero-Shot Segmentation VLMs for NSCLC Tumor Segmentation

    May 2, 2026Suraj Pai, Thibault Heintz, Cosmin Ciausu +3VLM RobustnessImage Segmentation

  4. Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

    Apr 30, 2026Jing Zhang, Wentao Jiang, Tao Huang +8Medical Image AnalysisMultimodal Reasoning

  5. Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

    Apr 30, 2026Xupeng Chen, Binbin Shi, Chenqian Le +5Multimodal RAGRetrieval-Augmented Generation

  6. Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation

    Apr 30, 2026Xupeng Chen, Binbin Shi, Chenqian Le +5VLM EvaluationHealthcare

  7. CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

    Apr 29, 2026Sonali Sharma, Jin Long, George Shih +7Chest X-Ray ClassificationMedical Image Analysis

  8. Toward Multimodal Conversational AI for Age-Related Macular Degeneration

    Apr 28, 2026Ran Gu, Benjamin Hou, Mélanie Hébert +5Medical DiagnosisMedical VQA

  9. Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

    Apr 28, 2026Jianghang Lin, Haihua Yang, Deli Yu +6Training Data CurationMultimodal QA

  10. Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

    Apr 24, 2026Weiqiu You, Cassandra Goldberg, Amin Madani +2EndoscopySurgical Video Understanding

  11. Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting

    Apr 22, 2026Alexander Weers, Daniel Rueckert, Martin J. MentenMedical Report GenerationHealthcare

  12. InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

    Apr 22, 2026Nicklas Neu, Thomas Ebner, Jasmin Primus +4VLM AdaptationMedical VLMs

  13. Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning

    Apr 21, 2026Palawat Busaranuvong, Reza Saadati Fard, Emmanuel Agu +4HealthcareMedical Diagnosis

  14. REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

    Apr 20, 2026Seowung Leem, Lin Gu, Chenyu You +2Alzheimer's DiseaseMedical Imaging

  15. ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification

    Apr 20, 2026Florian Kittler, Sheethal Bhat, Andreas MaierVLM RobustnessChest X-Ray Classification

  16. Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning

    Apr 20, 2026Xixi Liu, Jorge Lazo, Andreas Hallqvist +8Clinical Outcome PredictionMedical VLMs

  17. Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

    Apr 20, 2026Chengan Che, Chao Wang, Jiayuan Huang +2Surgical Video UnderstandingMedical VLMs

  18. BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs

    Apr 19, 2026Mainak Singha, Tanisha Gupta, Ankit Jha +3Cross-Modal LearningPrompt Learning

  19. PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

    Apr 19, 2026Yuanlong Wang, Weichi Chen, Adrian Rajab +4Computational PathologyMedical VQA

  20. When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

    Apr 19, 2026Akash Ghosh, Subhadip Baidya, Sriparna Saha +1VLM RobustnessAdversarial Attacks on VLMs

  21. DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation

    Apr 19, 2026Nagur Shareef Shaik, Teja Krishna Cherukuri, Dong Hye YeMedical ImagingMedical Report Generation

  22. Bias-constrained multimodal intelligence for equitable and reliable clinical AI

    Apr 18, 2026Cheng Li, Weijian Huang, Jiarun Liu +6Unified Multimodal ModelsAlgorithmic Fairness

  23. Expert-Annotated Embryo Image Dataset with Natural Language Descriptions for Evidence-Based Patient Communication in IVF

    Apr 16, 2026Nicklas Neu, Thomas Ebner, Jasmin Primus +4Medical VLMsExplainable Medical Image Analysis

  24. MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration

    Apr 13, 2026Jiahui Peng, He Yao, Jingwen Li +9Promptable Image SegmentationMultimodal Pretraining

  25. MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

    Apr 7, 2026Han Jang, Junhyeok Lee, Heeseong Eum +1HealthcareMedical VLMs

  26. SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

    Mar 31, 2026Shi Li, Vinkle Srivastav, Shih-Min Yin +7Medical VQASurgical Video Understanding

  27. Calibrated Confidence Expression for Radiology Report Generation

    Mar 31, 2026David Bani-Harouni, Chantal Pellegrini, Julian Lüers +6Radiology Report GenerationMedical VLMs

  28. A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling

    Mar 28, 2026Kirill Skobelev, Eric Fithian, Yegor Baranovski +9Surgical Video UnderstandingLanguage Model Scaling