Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

    May 28, 2026Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef +2Prompt SensitivityClinical Language Model Evaluation

  2. EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs

    May 28, 2026Yuzhang Xie, Keqi Han, Yunpeng Xiao +7HealthcareClinical Decision-Making

  3. AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis

    May 28, 2026Saeedeh Davoudi, Reihaneh Iranmanesh, Ophir Frieder +1HealthcarePrivacy Leakage in Language Models

  4. Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate

    May 28, 2026David Fraile Navarro, Berardino Como, Jialei Sheng +2HealthcareClinical Triage

  5. SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

    May 27, 2026Chao Ding, Mouxiao Bian, Tianbin Li +12HealthcareLLM Auditing

  6. Do Clinical Models Change Treatment Decisions?

    May 27, 2026Dongkyu Cho, Miao Zhang, Rumi ChunaraHealthcareClinical Decision-Making

  7. MIRA: A Bilingual Benchmark for Medical Information Response Audit

    May 27, 2026Mengyu Xu, Qiaoxin Yang, Qianqian Wang +3Multilingual Language Model EvaluationHealthcare

  8. A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks

    May 26, 2026Heriberto Cuayahuitl, Grace JangHealthcareSpeech Processing

  9. Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

    May 25, 2026Fay Elhassan, David Sasu, Alexandra Kulinkina +2LLM Safety BenchmarksHuman Preference Evaluation

  10. AI Content Moderation in Therapy Conversations

    May 25, 2026Jiwon Kim, Claire Wang, Taeung Yoon +2LLM AuditingLLM Guardrails

  11. Privacy-Preserving Local Language Models for Longitudinal Data Retrieval in Chronic Dermatologic Disease: Implementation in Pemphigus Patients

    May 24, 2026Abdurrahim Yilmaz, Ayşe Esra Koku Aksu, Duygu Yamen +5Privacy-Preserving Language ModelsHealthcare

  12. When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening

    May 22, 2026Jianfeng Zhu, Megan Korhummel, Ruoming Jin +1Medical DiagnosisMental Health

  13. Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions

    May 21, 2026Naveen Raman, Santiago Cortes-Gomez, Mateo Dulce Rubio +2HealthcareBenchmark Design

  14. Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support

    May 21, 2026Chen Zhan, Xihe Qiu, Xiaoyu Tan +8HealthcareClinical Decision Support

  15. GraphRAG on Consumer Hardware: Benchmarking Local LLMs for Healthcare EHR Schema Retrieval

    May 20, 2026Peter Fernandes, Ria KanjilalLLM Inference EfficiencyLLM Grounding

  16. Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

    May 20, 2026Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat MasoodLanguage Model Safety EvaluationHealthcare

  17. Prompting language influences diagnostic reasoning and accuracy of large language models

    May 18, 2026Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed +1Multilingual Language Model EvaluationLLM Prompting

  18. Evaluating the Utility of Personal Health Records in Personalized Health AI

    May 18, 2026Rory Sayres, Kejia Chen, Ayush Jain +19LLM PersonalizationHealthcare

  19. Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale

    May 18, 2026Jinghui Liu, Sarvesh Soni, Anthony NguyenSynthetic Data AugmentationAutomated Medical Coding

  20. Adversarial Fragility and Language Vulnerability in Clinical AI: A Systematic Audit of Diagnostic Collapse Under Imperceptible Perturbations and Cross-Lingual Drift in Low-Resource Healthcare Settings

    May 16, 2026Anthonio Oladimeji Gabriel, Ahmad Rufai YusufMultilingual Language Model EvaluationHealthcare