Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. Large language models are vulnerable to incidental information in clinical documentation and reasoning

    Oct 6, 2026Krithik Vishwanath, Brandon Ye, Anton Alyakin +4Medical Report GenerationClinical Language Model Evaluation

  2. Language-model ratings of depression reflect the rater more than the patient

    Oct 6, 2026Baihan LinInter-Rater ReliabilityAnnotator Disagreement

  3. COMPASS 2.0: psychometric representational similarity analysis distinguishes symptom structure from personal signal

    Oct 5, 2026Baihan LinRepresentational Similarity AnalysisPsychometric Validation

  4. Decide, Ask, or Defer: Clinical LLMs under Incomplete Evidence

    Oct 3, 2026Mingzhan Yang, Weili WuClinical Decision-MakingClinical Language Model Evaluation

  5. Clinical Concept Centers in LLMs

    Oct 2, 2026Aishik Nagar, Abhishek Vaidyanathan, Arun-Kumar Kaliya-Perumal +2Mechanistic InterpretabilityCausal Interventions in Language Models

  6. Counterfactual Auditing of Bias in Open-Source Large Language Models for Clinical Triage

    Oct 1, 2026Manar Aljohani, Brandon Ho, Kenneth McKinley +2Clinical Decision-MakingLanguage Model Bias Evaluation

  7. A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined

    Oct 1, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoFaithfulness of Language Model ExplanationsTemporal Reasoning in Language Models

  8. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1LLM Safety BenchmarksLLM Auditing

  9. UniBuc at SemEval-2024 Task 2: Tailored Prompting with Solar for Clinical NLI

    Sep 30, 2026Marius Micluta-Campeanu, Claudiu Creanga, Ana-Maria Bucur +2Clinical Language Model EvaluationClinical NLP

  10. Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts

    Sep 29, 2026Abinitha Gourabathina, Haoran Zhang, Yuexing Hao +2Clinical TriageClinical Decision-Making

  11. MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models

    Sep 29, 2026Lukas Thede, Yash Kumar Atri, David Chen +4Continual Learning for LLMsFactual Knowledge in Language Models

  12. KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

    Sep 29, 2026Xueting Fang, Zehui Li, Yang Yang +5Clinical Decision-MakingMulti-Turn Dialogue Evaluation

  13. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoClinical ReasoningRubric-Based Evaluation

  14. Understanding Clinical Cognitive Dialogues Using Large Language Models

    Sep 28, 2026Vishalakshi Arumugam, Dan Schumacher, Veronica Rammouz +3Intent ClassificationMulti-Turn Dialogue Evaluation

  15. Jev in Medicine: A Benchmark Evaluation

    Sep 27, 2026Alfredo Madrid-García, Beatriz Merino-BarbanchoMedical QAClinical Reasoning

  16. OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories

    Sep 26, 2026Anqi Li, Zhixuan Ge, Yixuan Duan +9Clinical Decision-MakingOncology

  17. A Living Benchmark for Information Retrieval from Electronic Health Records

    Sep 24, 2026Jordan L. Cahoon, Chloe O. Stanwyck, Sulaiman Somani +23Synthetic Benchmark GenerationClinical QA

  18. Language Specificity vs. Domain Diversity: Benchmarking Transformers for Bangla Medical NER

    Sep 24, 2026Rakib Abdullah, Md. Maruful Islam MarufNamed Entity RecognitionMultilingual Language Model Evaluation

  19. Misaligned Clinical Risk Classification and Cost Asymmetry in Open-Weight Large Language Models

    Sep 21, 2026Star S. D. Liu, Xiyu Ding, Robert B. Barrett +3Cost-Sensitive LearningLLM Interpretability

  20. LLMs Anchor on Chief Complaint and Fail to Integrate Evidence in Sequential Clinical Triage

    Sep 19, 2026Dipankar Srirag, Haokai Zhao, Ashutosh Kumar +6Clinical TriageClinical Reasoning

  21. HerHealthEval: Evaluating Multilingual and Register-Sensitive Understanding of Women's Health Communication

    Sep 17, 2026Hassan Saeed Hassan Albattra, Mazen Mohammed Bahgat, Rahatara Ferdousi +2Multilingual Language Model EvaluationHealthcare

  22. Japanese Stroke LLM Evaluation: A Conversational Benchmark for Safe Stroke Care in Japanese Using Large Language Models

    Sep 15, 2026Keisuke Masuda, Kazutaka Yatsushiro, Hirohumi Iwamoto +2LLM Safety BenchmarksHealthcare

  23. Challenges of Auditing: Variability in Outputs of Large Language Models for Health

    Sep 15, 2026Yuan Pu, Yewon Chang, Furong Jia +4LLM EvaluationLLM Auditing

  24. Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

    Sep 14, 2026Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah +1LLM GroundingLLM Answer Verification