cs.CVOct 5, 2026

BrainTRACE: Tracing Longitudinal, Multimodal, and Volumetric Evidence in Brain MRI Clinical Reasoning

Authors: Qizhen Lan, Mengchen Fan, Hang Zhang, Jingwei Duan, Moule Lin, Jialin Chen, Baocheng Geng, Xiaoqian Jiang

Organizations: University of Texas Health Science Center at Houston · University of Alabama at Birmingham · University of Pittsburgh · The University of Texas MD Anderson Cancer Center · University of Dublin, Trinity College · Yale University

Abstract

Brain MRI interpretation is a longitudinal clinical reasoning problem: radiologists compare serial studies, integrate information across MRI sequences, localize findings within volumetric anatomy, and translate this evidence into report-grounded assessments. Existing medical VQA and 3D imaging benchmarks capture important parts of this workflow, but often evaluate brain MRI through isolated images, static volumes, or ungrounded report-style answers, thereby obscuring failures in the evidence chain that support clinical validity. We introduce BrainTRACE, a report-grounded benchmark for evaluating whether vision-language models can trace the evidence structure required for longitudinal brain MRI interpretation. BrainTRACE contains 7,273 scored VQA instances derived from 1,778 longitudinal patients, 7,299 MRI studies, and approximately 29k co-registered 3D MRI sequence volumes. The benchmark is organized by five levels of clinical reasoning, from acquisition recognition to case-level synthesis, and by evidence demands covering longitudinal comparison, report-grounded references, multi-sequence integration, and volumetric spatial evidence. BrainTRACE supports rendered inputs compatible with standard VLM interfaces, a 3D-evidence condition, and a decomposed case-reasoning track that audits six steps in a longitudinal evidence chain. Evaluation of 20 VLM configurations shows that current systems can identify isolated visual cues but rarely compose them into grounded longitudinal interpretations. We release the benchmark specification, evaluation lists, scoring implementation, scoring rubrics, and audit-record format to support reproducible progress in brain MRI VLM evaluation.

Figures & tables

Appendix figures & tables19 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

    May 19, 2026Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh +12Healthcare3D Medical Imaging

  2. Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

    Apr 17, 2026Lama Moukheiber, Caleb M. Yeung, Haotian Xue +33D Spatial Reasoning3D Medical Imaging

  3. How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?

    Aug 13, 2026Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura +6Radiology VLMsMedical Image Analysis