Clinical Language Model Evaluation

Latest papers 261

All topics
CardsList
  1. Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

    Jun 17, 2026Qingyu Lu, Ruochen Li, Liang Ding +3Clinical Language Model EvaluationLanguage Model Robustness

  2. Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

    Jun 17, 2026Tianming Du, Peijie Yu, Sihan Shang +12AI Agent BenchmarksClinical Language Model Evaluation

  3. RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

    Jun 16, 2026Weizhi Zhang, Zechen Li, Hamid Palangi +16AI Agent EvaluationHuman-in-the-Loop Evaluation

  4. Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour

    Jun 16, 2026Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh +5Emotional Support ConversationMental Health

  5. Reading between the Lines: Leveraging Large Language Models for Global Dementia and Depression Assessment from Clinical Interviews

    Jun 16, 2026Franziska Braun, Alea Rüggeberg, Thomas Ranzenberger +4Depression DetectionMental Health

  6. AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

    Jun 16, 2026Jiahui Niu, Huizi Yu, Wenkong Wang +11Clinical ReasoningClinical Language Model Evaluation

  7. EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries

    Jun 14, 2026Jiyoun Kim, Muhan Yeo, Eunhye Jang +14Clinical QAEvidence-Grounded Generation

  8. Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

    Jun 13, 2026Zaifu Zhan, Shuang Zhou, Rui ZhangMulti-Agent LLM SystemsLLM Answer Verification

  9. Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System

    Jun 10, 2026Alyssa Unell, Miguel Fuentes, Brenna Li +4LLM GuardrailsClinical Language Model Evaluation

  10. Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

    Jun 10, 2026Hongjian Zhou, Xinyu Zou, Jinge Wu +19LLM ReliabilityMedical QA

  11. Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

    Jun 10, 2026Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski +7LLM EvaluationLLM Reliability

  12. DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

    Jun 10, 2026Guido Freire, Agustín Martínez-Suñé, Viviana CotikHealthcareAI Control

  13. CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

    Jun 8, 2026Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab +1LLM EvaluationCultural Bias in Language Models

  14. Clinically Grounded Privacy Evaluation of Medical LMs

    Jun 8, 2026Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle +6Data LeakageMemorization in Language Models

  15. SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

    Jun 6, 2026Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi +3LLM EvaluationSynthetic Benchmark Generation

  16. From 'May' to 'Is': Certainty Distortion in Language Model Rewriting

    Jun 6, 2026Catarina G Belem, Shang Wu, Hongyu Yao +3Scientific CommunicationLanguage Model Calibration

  17. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  18. Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

    Jun 5, 2026Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima +1Multilingual Language Model EvaluationClinical Decision-Making

  19. Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

    Jun 4, 2026Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang +4ASR EvaluationLanguage Model Safety Evaluation

  20. PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

    Jun 3, 2026Keqi Han, Ryan Young, Annabel Strauss +7HealthcareAI Agent Benchmarks

  21. Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

    Jun 3, 2026Alejandro Lozano, Keiko Ihara, Ping-Hao Yang +13Text SummarizationRAG Evaluation

  22. Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

    Jun 3, 2026Cheng Liang, Pengcheng Qiu, Ya Zhang +3LLM Agent EvaluationAI Agent Benchmarks

  23. When Clients Stop Following: A Cognitive Conceptualization Diagram-driven Framework for Strategic Counseling

    Jun 3, 2026Yihao Qin, Junyi Zhao, Changsheng Ma +4Mental Health CounselingCognitive Modeling

  24. AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making

    Jun 2, 2026Sangwon Baek, Kyu Yeon Hur, Kyunga KimLLM-as-a-JudgeClinical Decision Support

  25. ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models

    Jun 2, 2026Ruihui Hou, Siyi Zhu, Ziyue Huai +4Clinical Decision-MakingClinical Language Model Evaluation