Medical Image Benchmarks

Latest papers 237

All topics
CardsList
  1. VEELA: A Clinically-Constrained Benchmark for Liver Vessel Segmentation in Computed Tomography Angiography

    May 21, 2026Ziya Ata Yazıcı, N. Sinem Gezer, İlkay Öksüz +19Medical Image SegmentationComputed Tomography

  2. JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation

    May 21, 2026Yue Xun, Junyu Liu, Qian Niu +10VLM EvaluationHealthcare

  3. NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

    May 19, 2026Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh +12Healthcare3D Medical Imaging

  4. HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

    May 19, 2026Haoyu Wang, Zitong LiVision-Language ModelsAudio-Language Model Hallucination Detection

  5. Understanding Model Behavior in Monocular Polyp Sizing

    May 19, 2026Xinqi Xiong, Andrea Dunn Beltran, Junmyeong Choi +3EndoscopyMedical Image Classification

  6. WBCAtt+: Fine-Grained Pixel-Level Morphological Annotations for White Blood Cell Images

    May 19, 2026Satoshi Tsutsui, Winnie Pang, Shuting He +1Medical Image AnalysisMedical Image Segmentation

  7. Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis

    May 19, 2026Tianwei Lin, Zhongwei Qiu, Jie Cao +7Radiology Report GenerationRadiology VLMs

  8. MedFM-Robust: Benchmarking Robustness of Medical Foundation Models

    May 18, 2026Xiangxiang Cui, Tianjin Huang, Yifang Wang +2Multimodal RobustnessNeural Network Robustness

  9. Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks

    May 18, 2026Jue Jiang, Harini VeeraraghavanCross-Modality Medical Image SegmentationSelf-Supervised Pre-Training

  10. RadGenome-Anatomy: A Large-Scale Anatomy-Labeled Chest Radiograph Dataset via Physically Grounded Volumetric Projection

    May 17, 2026Shuchang Ye, Mingyuan Meng, Hao Wang +2Medical ImagingMedical Image Segmentation

  11. UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

    May 16, 2026Shiv Ghosh, Junayd Lateef, Chih-Hua Liu +3VLM EvaluationMedical VQA

  12. SCARED-C: Corrected Camera Poses for Endoscopic Depth Estimation

    May 15, 2026John J. Han, Adam Schmidt, Max Allan +2EndoscopyDepth Estimation

  13. MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

    May 15, 2026Sunghwan Steve Cho, Yunseok Han, Jaeyoung DoVLM EvaluationHealthcare

  14. CT-DegradBench: A Physics-Informed Benchmark for CT Degradation Detection and Severity Estimation

    May 14, 2026Yousra Nabila Taifour, Marouane Tliba, Zuheng Ming +9Image Quality AssessmentComputed Tomography

  15. Cross Modality Image Translation In Medical Imaging Using Generative Frameworks

    May 13, 2026Giulia Romoli, Filippo Ruffini, Francesco Di Feola +20Image-to-Image TranslationMedical Image Synthesis

  16. Generating synthetic computed tomography for radiotherapy: SynthRAD2025 challenge report

    May 13, 2026Viktor Rogowski, Maarten L. Terpstra, Niklas Wahl +30Cone-Beam CTMedical Image Synthesis

  17. CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography

    May 11, 2026Eva Prakash, Yunhe Gao, Chong Wang +10VLM RobustnessChest X-Ray Classification

  18. RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

    May 11, 2026Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou +3HealthcareMedical VQA

  19. Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models

    May 11, 2026Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari +8HealthcareHallucination Detection

  20. DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

    May 10, 2026Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi +7VLM EvaluationTool Use in VLMs

  21. Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

    May 9, 2026Mashrafi Monon, Umaima Rahman, Asif Hanif +2VLM Evaluation3D Spatial Reasoning

  22. MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

    May 8, 2026Hanqi Jiang, Junhao Chen, Mingyu Kang +12VLM EvaluationVLM Robustness

  23. Benchmarking Foundation Models for Renal Lesion Stratification in CT

    May 8, 2026Hartmut Häntze, Sarah de Boer, Myrthe Buser +7Medical Imaging Foundation ModelsMedical Image Classification

  24. A Paired Point-of-Care Ultrasound Dataset for Image Quality Enhancement and Benchmarking via a cGAN Baseline

    May 8, 2026Lennard M. van Karnenbeek, Hilde G. A. van der Pol, Mark Wijkhuizen +5Image-to-Image TranslationUltrasound Imaging

  25. Beyond Forgetting in Continual Medical Image Segmentation: A Comprehensive Benchmark Study

    May 7, 2026Bomin Wang, Hangqi Zhou, Yibo Gao +1Interactive Medical Image SegmentationStability-Plasticity Dilemma

  26. CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

    May 7, 2026Zhengru Fang, Yanan Ma, Yu Guo +5VLM EvaluationChest X-Ray Classification

  27. The autoPET3 Challenge: Automated Lesion Segmentation in Whole-Body PET/CT \unicodex2013\unicode{x2013} Multitracer Multicenter Generalization

    May 7, 2026Jakob Dexl, Katharina Jeblick, Andreas Mittermeier +27Domain GeneralizationPET/CT Imaging

  28. iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

    May 7, 2026Fakrul Islam Tushar, Umme Hafsa Momy, Joseph Y. Lo +1VLM EvaluationRadiology VLMs