Medical VQA

VQA: Visual Question Answering

Momentum

10 papers in the last four weeks, up 67% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 115

All topics
CardsList
  1. Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs

    Jul 29, 2026Itbaan Safwan, Ramail Khan, Muhammad Annas Shaikh +1EndoscopyMedical VQA

  2. ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

    Jul 27, 2026Hangjie Yuan, Yichen Qian, Zhiwei Tang +21Medical Report GenerationMedical VQA

  3. PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

    Jul 26, 2026Chi Phan, Tianyi Zhang, Yufeng Wu +7Computational PathologyMedical VQA

  4. Do Pathology Vision-Language Models Truly See Pathology?

    Jul 23, 2026Chengyang Zhang, Wenchuan Zhang, Bo Li +10VLM EvaluationComputational Pathology

  5. Pathologist Attention-Aligned Report Generation for Prostate Histopathology

    Jul 21, 2026Ruoyu Xue, Suryakant Singh, Souradeep Chakraborty +12Computational PathologyMedical Report Generation

  6. Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA

    Jul 20, 2026Yuhao Liu, Cheng Zhao, Guanghui YueVLM EvaluationEndoscopy

  7. Can Multimodal Large Language Models Understand OCT?

    Jul 18, 2026Baochen Fu, Wenzhi Deng, Baihao Jin +5Medical ImagingMedical Image Analysis

  8. FM2^2: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

    Jul 15, 2026Shengchao Chen, Ting ShuMultimodal Federated LearningCross-Modal Alignment

  9. Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

    Jul 14, 2026Wenhao Zhang, Zhongliang Zhou, John Kang +1VLM EvaluationData Leakage

  10. An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering

    Jul 13, 2026Mai A. Shaaban, Tausifa Jan Saleem, Alaa Mohamed +3Medical VQAContinual Learning for VLMs

  11. IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

    Jul 5, 2026Hao Wei, Wenjin Qi, Dasen Dai +2Visual Question AnsweringVision-Language Models

  12. Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs

    Jul 4, 2026Anas Zafar, Leema Krishna Murali, Siddhant Bharadwaj +2VLM EvaluationCounterfactual Evaluation

  13. Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

    Jun 30, 2026Junha Jung, Minbyul Jeong, Suhyeon Lim +5Process Reward ModelsMedical VQA

  14. Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

    Jun 30, 2026Kaitao Chen, Weiqian Zhao, Jiamin Wu +6Efficient Multimodal InferenceMedical VQA

  15. Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

    Jun 30, 2026Rui Hao, Qiankun Li, Junyuan Mao +4Radiology Report GenerationMedical VQA

  16. Aloe-Vision: Robust Vision-Language Models for Healthcare

    Jun 25, 2026Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández +3VLM EvaluationVLM Robustness

  17. Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

    Jun 25, 2026Eren Senoglu, Federico Toschi, Nicolo Brunello +2Medical VQALanguage Model Calibration

  18. SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

    Jun 24, 2026Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang +8Medical VQASurgical Video Understanding

  19. Multilingual Hematology Visual Question Answering Dataset

    Jun 24, 2026Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman +2Medical VQAMedical VLMs

  20. Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

    Jun 18, 2026Yusuf Salcan, Simon Ging, Robin Tibor Schirrmeister +4Radiology Report GenerationRadiology VLMs

  21. Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

    Jun 16, 2026Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse +2VLM EvaluationMedical VQA

  22. Vision-language models for chest radiography do not always need the image

    Jun 16, 2026Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams +4VLM EvaluationMedical VQA

  23. Enhancing Pathological VLMs with Cross-scale Reasoning

    Jun 16, 2026Chi Phan, Tianyi Zhang, Qiaochu Xue +5Visual Question AnsweringComputational Pathology

  24. Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

    Jun 15, 2026Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna +2VLM EvaluationVLM Robustness

  25. Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

    Jun 14, 2026Reza Khanmohammadi, Kundan Thind, Mohammad M. GhassemiVLM EvaluationSelective Prediction

  26. Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

    Jun 14, 2026Yiping Li, Ronald de Jong, Romy van Jaarsveld +5Medical VQASurgical Video Understanding

  27. OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

    Jun 11, 2026Ibrahim Gulluk, Max Van Puyvelde, Olivier GevaertMedical VQAMedical Image Classification

  28. OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

    Jun 10, 2026Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci +6Medical VQAMedical VLMs