cs.CVOct 5, 2026

A doctrine-grounded visual question answering dataset for Tactical Combat Casualty Care

Authors: Junseob Kim, Jade Chng, Ayman Ali, Victor Moas, Yichun Lee, Po-Chun Chin, Sunil Hwang, Rishikesan Kamaleswaran

Organizations: Department of Electrical and Computer Engineering, Duke University, Durham, NC, USA · Department of Biomedical Engineering, Duke University, Durham, NC, USA · Department of Surgery, Duke University, Durham, NC, USA · School of Medicine, College of Medicine, National Yang Ming Chiao Tung University, Taipei, Taiwan · Department of Mathematics, Korea Military Academy, Seoul, South Korea · Department of Anesthesiology, Duke University, Durham, NC, USA

Abstract

Tactical Combat Casualty Care (TC3) requires responders to connect visual observations of injuries and interventions with established clinical guidance. Developing vision-language models to support this process requires supervision that links visible evidence to traceable doctrine. We present TC3-VQA, a dataset constructed from public instructional and field TC3 videos and authoritative TC3 documents. It contains 581 items spanning 11 concepts, with 1,860 questions covering intervention recognition, doctrine, clinical reasoning, procedural guidance, and refusal when visual information is insufficient. Doctrine-based answers preserve verbatim source passages and character offsets. Construction combines visual annotation, passage retrieval, entailment checks, and verification across model families. Equipment boxes, anatomical labels, temporal segments, and source metadata accompany the question-answer pairs. Automated audits and ratings by two physicians and two medical students characterize annotation quality, with human ratings available for 88 retained items. The dataset provides a resource for adapting vision-language models to TC3, studying the connection between visual evidence and clinical knowledge, and evaluating recognition, doctrine recall, and abstention.

Figures & tables

Explore similar work

CardsList
  1. SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?

    May 3, 2026Jongmin Shin, Ka Young Kim, Eunki Cho +2Surgical VideosSurgery

  2. Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

    Aug 13, 2026Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik +3Medical Visual Question AnsweringMultiple-Choice Visual Question Answering

  3. DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

    May 10, 2026Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi +7Medical Vision-Language ModelsTextvqa