Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

    May 2, 2026Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer +32LLM EvaluationHealthcare

  2. Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines

    May 1, 2026Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo +1Knowledge Augmentation for Language ModelsHealthcare

  3. CLEAR: Revealing How Noise and Ambiguity Degrade Reliability in LLMs for Medicine

    May 1, 2026Kevin H. Guo, Chao Yan, Avinash Baidya +5HealthcareLLM Reliability

  4. Domain-Adapted Small Language Models for Reliable Clinical Triage

    Apr 29, 2026Manar Aljohani, Brandon Ho, Kenneth McKinley +2Clinical TriageLLM Fine-Tuning

  5. PSI-Bench: Interpretable and Clinically Meaningful Evaluation of Depression Patient Simulators

    Apr 28, 2026Nguyen Khoi Hoang, Shuhaib Mehri, Tse-An Hsu +4Benchmark DesignClinical Language Model Evaluation

  6. Single-turn emergency psychiatric triage across 15 frontier AI chatbots

    Apr 28, 2026Veith Weilnhammer, Lennart Luettgau, Christopher Summerfield +5HealthcareClinical Triage

  7. Analyzing LLM Reasoning to Uncover Mental Health Stigma

    Apr 27, 2026Sreehari Sankar, Aliakbar Nafar, Mona Barman +8LLM EvaluationSocial Bias in Language Models

  8. Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

    Apr 27, 2026Aaryan Shah, Andrew Hines, Alexia Downs +6LLM-as-a-JudgeHuman-AI Agreement

  9. Green Shielding: A User-Centric Approach Towards Trustworthy AI

    Apr 27, 2026Aaron J. Li, Nicolas Sanchez, Hao Huang +8Prompt SensitivityClinical Language Model Evaluation

  10. Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus

    Apr 27, 2026Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk +21HealthcareLLM Agent Evaluation

  11. AI Safety Training Can be Clinically Harmful

    Apr 25, 2026Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga +2Mental Health CounselingLLM Alignment

  12. Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

    Apr 23, 2026Shevya Panda, Shinjini Bose, Ananya JoshiPrompt SensitivityLLM Auditing

  13. Evaluating Patient Safety Risks in Generative AI: Development and Validation of a FMECA Framework for Generated Clinical Content

    Apr 23, 2026Lydie Bednarczyk, Jamil Zaghir, Julien Ehrsam +11Clinical Language Model EvaluationMedical LLMs

  14. When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure

    Apr 23, 2026Boyu Xiao, Xiuqi Tian, Xuwen Song +4LLM SycophancyHealthcare

  15. Can "AI" Be a Doctor? A Study of Empathy, Readability, and Alignment in Clinical LLMs

    Apr 22, 2026Mariano Barone, Francesco Di Serio, Roberto Moio +4HealthcareLLM Prompting

  16. Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

    Apr 22, 2026Aishik Mandal, Hiba Arnaout, Clarissa W. Ong +5Mental Health CounselingMental Health

  17. Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models

    Apr 21, 2026Kihyuk LeeLLM EvaluationClinical Language Model Evaluation

  18. MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline

    Apr 20, 2026Jiyao Liu, Jianghan Shen, Sida Song +19HealthcareAI Agent Benchmarks

  19. First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows

    Apr 20, 2026Sihao Xing, Zaur GoulievHealthcareSocial Bias in Language Models

  20. MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

    Apr 20, 2026Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav +2Mental Health CounselingLLM Evaluation

  21. Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA

    Apr 19, 2026Alberto Testoni, Iacer CalixtoHealthcareSocial Bias in Language Models

  22. Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

    Apr 18, 2026Bruce A. Bassett, Amy Rouillard, Sitwala Mundia +8Language Model Safety EvaluationHealthcare

  23. Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

    Apr 16, 2026Zhijun Guo, Alvina Lai, Emmanouil Korakas +6Clinical Decision SupportRAG Evaluation

  24. Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

    Apr 16, 2026Amy Rouillard, Sitwala Mundia, Linda Camara +8LLM-as-a-JudgeHealthcare