Medical VQA

VQA: Visual Question Answering

Momentum

10 papers in the last four weeks, up 67% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 115

All topics
CardsList
  1. A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

    Jun 8, 2026Bruce Changlong Xu, Lan Wu, Alexander RyuVLM EvaluationMedical VQA

  2. Noise-Aware Visual Representation Learning for Medical Visual Question Answering

    Jun 4, 2026I Putu Adi Pratama, Bahadorreza Ofoghi, Atul Sajjanhar +1VLM RobustnessDenoising Autoencoders

  3. Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

    Jun 3, 2026Jialin Wu, Qianru Zhang, Georges El Fakhri +1Vision Foundation Model AdaptationMedical VQA

  4. Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

    Jun 2, 2026Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto YudistiraVLM EvaluationVLM Robustness

  5. Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

    Jun 1, 2026Bo Liu, Hanxue Gu, Xiangru Li +6VLM EvaluationMedical Imaging

  6. Ask4VG: Risk-Aware Question Selection for Reducing Prior-Driven Answers in Medical VQA

    May 31, 2026Xiaorong Zhu, Qiang Li, Zibo Xu +2Medical VQAVLM Hallucination Mitigation

  7. Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

    May 30, 2026Yeqi Huang, Yue Chen, Yanwei Ye +2VLM AdaptationSynthetic Data Generation

  8. Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

    May 28, 2026Kai Bian, Xucheng Guo, Bin Chen +4Medical ImagingEfficient VLM Inference

  9. VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs

    May 27, 2026Qiaoru Li, Shaotian Liang, Jintao Chen +4Medical VQAVLM Interpretability

  10. OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Xiwen Chen +13Medical Image AnalysisMedical VQA

  11. Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

    May 25, 2026Xiaotian Hu, Mingxuan Liu, Junwei Huang +13Multi-Agent LLM SystemsMedical VQA

  12. Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

    May 24, 2026Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa +1EndoscopyMedical Imaging

  13. EchoVQA: Enabling Conversational Assistance for Point-of-Care Cardiac Ultrasound

    May 22, 2026Filippos Bellos, Yutong Li, Jessie N Dong +6Medical VQAEchocardiography

  14. PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

    May 22, 2026Chunze Yang, Qidong Liu, Wenjie Zhao +10HealthcareMedical VQA

  15. RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

    May 21, 2026Chengyi Zhang, Zi Ye, Ziyang WangMedical VQAMedical Image Benchmarks

  16. Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

    May 21, 2026Xingyue Wang, Bo Liu, Meng Wang +4Medical VQAFundus Imaging

  17. JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation

    May 21, 2026Yue Xun, Junyu Liu, Qian Niu +10VLM EvaluationHealthcare

  18. Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming

    May 20, 2026Yue Zhou, Erxuan Wu, Yikang Sun +5Visual Question AnsweringUncertainty Estimation for VLA Models

  19. VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering

    May 20, 2026Jiayi Chen, Benteng Ma, Zehui Liao +3Hallucination Detection in VLMsHealthcare

  20. NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

    May 19, 2026Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh +12Healthcare3D Medical Imaging

  21. Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

    May 19, 2026Guangzhi Xiong, Qiao Jin, Sanchit Sinha +2Medical VQAVLM Interpretability

  22. M3QuestionIngM^3 QuestionIng: Multi-modal Multi-span Medical Question Answering

    May 19, 2026Anisha Saha, Vaibhav Rathore, Abhisek Tiwari +3Medical VQAMultimodal QA

  23. Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering

    May 18, 2026Luca Hagen, Johanna P. Müller, Weitong Zhang +2HealthcareEfficient VLM Inference

  24. How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

    May 18, 2026Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain +3VLM EvaluationMultilingual Language Model Evaluation

  25. SurgLQA: Scalable Long-Horizon Surgical Video Question Answering

    May 18, 2026Diandian Guo, Xikai Yang, Ruiyang Li +2Temporal Video GroundingTest-Time Scaling

  26. UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

    May 16, 2026Shiv Ghosh, Junayd Lateef, Chih-Hua Liu +3VLM EvaluationMedical VQA

  27. MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

    May 15, 2026Sunghwan Steve Cho, Yunseok Han, Jaeyoung DoVLM EvaluationHealthcare

  28. RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding

    May 15, 2026Jiayan Yang, Zhuoyu Wu, Wenqi FangHealthcareEfficient VLM Inference

  29. Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

    May 11, 2026Ruinan Jin, Beidi Zhao, Myeongkyun Kang +2VLM EvaluationVision-Language Models