Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

    Jun 16, 2026Weizhi Zhang, Zechen Li, Hamid Palangi +16AI Agent EvaluationHuman-in-the-Loop Evaluation

  2. Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour

    Jun 16, 2026Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh +5Emotional Support ConversationMental Health

  3. Reading between the Lines: Leveraging Large Language Models for Global Dementia and Depression Assessment from Clinical Interviews

    Jun 16, 2026Franziska Braun, Alea Rüggeberg, Thomas Ranzenberger +4Depression DetectionMental Health

  4. AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

    Jun 16, 2026Jiahui Niu, Huizi Yu, Wenkong Wang +11Clinical ReasoningClinical Language Model Evaluation

  5. EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries

    Jun 14, 2026Jiyoun Kim, Muhan Yeo, Eunhye Jang +14Clinical QAEvidence-Grounded Generation

  6. Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

    Jun 13, 2026Zaifu Zhan, Shuang Zhou, Rui ZhangMulti-Agent LLM SystemsLLM Answer Verification

  7. Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System

    Jun 10, 2026Alyssa Unell, Miguel Fuentes, Brenna Li +4LLM GuardrailsClinical Language Model Evaluation

  8. Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

    Jun 10, 2026Hongjian Zhou, Xinyu Zou, Jinge Wu +19LLM ReliabilityMedical QA

  9. Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

    Jun 10, 2026Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski +7LLM EvaluationLLM Reliability

  10. DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

    Jun 10, 2026Guido Freire, Agustín Martínez-Suñé, Viviana CotikHealthcareAI Control

  11. CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

    Jun 8, 2026Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab +1LLM EvaluationCultural Bias in Language Models

  12. Clinically Grounded Privacy Evaluation of Medical LMs

    Jun 8, 2026Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle +6Data LeakageMemorization in Language Models

  13. SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

    Jun 6, 2026Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi +3LLM EvaluationSynthetic Benchmark Generation

  14. From 'May' to 'Is': Certainty Distortion in Language Model Rewriting

    Jun 6, 2026Catarina G Belem, Shang Wu, Hongyu Yao +3Scientific CommunicationLanguage Model Calibration

  15. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  16. Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

    Jun 5, 2026Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima +1Multilingual Language Model EvaluationClinical Decision-Making

  17. Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

    Jun 4, 2026Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang +4ASR EvaluationLanguage Model Safety Evaluation

  18. PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

    Jun 3, 2026Keqi Han, Ryan Young, Annabel Strauss +7HealthcareAI Agent Benchmarks

  19. Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

    Jun 3, 2026Alejandro Lozano, Keiko Ihara, Ping-Hao Yang +13Text SummarizationRAG Evaluation

  20. Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

    Jun 3, 2026Cheng Liang, Pengcheng Qiu, Ya Zhang +3LLM Agent EvaluationAI Agent Benchmarks

  21. When Clients Stop Following: A Cognitive Conceptualization Diagram-driven Framework for Strategic Counseling

    Jun 3, 2026Yihao Qin, Junyi Zhao, Changsheng Ma +4Mental Health CounselingCognitive Modeling

  22. AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

    Jun 2, 2026Sangwon Baek, Kyu Yeon Hur, Kyunga KimLLM-as-a-JudgeClinical Decision Support

  23. ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models

    Jun 2, 2026Ruihui Hou, Siyi Zhu, Ziyue Huai +4Clinical Decision-MakingClinical Language Model Evaluation

  24. Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

    Jun 1, 2026Giulia Pucci, Emily Hemendinger, Ruizhe Li +3Mental HealthLLM Safety