Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. CARE-Bench: Benchmarking Patient-Facing LLM Triage

    Aug 4, 2026Yining Hua, Hongbin Na, Cyrus AyubchaLLM Safety BenchmarksClinical Triage

  2. Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

    Aug 4, 2026Zhitian Hou, Yuhang Liu, Pengkai Wang +8Counterfactual EvaluationHealthcare

  3. MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

    Aug 3, 2026Saman Sarker Joy, Niloy FarhanLLM Safety BenchmarksLLM Sycophancy

  4. High-Stakes Decisions with Language Models: Insights from Emergency Triage

    Aug 2, 2026Khurram Yamin, Christopher Kelly, Bryan Wilder +1Clinical TriageClinical Decision-Making

  5. Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

    Aug 2, 2026Kaike Ping, Buse Çarık, Caleb Wohn +3LLM SycophancyLanguage Modeling

  6. Large language models improve physician accuracy but lead to false reliance

    Aug 1, 2026Tirtha Chanda, Christoph Wies, Franziska Schramm +10Retrieval-Augmented GenerationLLM Grounding

  7. Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

    Jul 31, 2026Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau +2Language Model EnsemblesClinical Language Model Evaluation

  8. Performance of large language models in the optical diagnosis of colorectal polyps

    Jul 31, 2026Joshua C. Vences, William T. Tran, Nikko Gimpaya +15EndoscopyMultimodal Large Language Models

  9. EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

    Jul 30, 2026Jiahui Li, Ruili Fang, Zishuai Liu +5Medical DiagnosisClinical Prediction

  10. Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

    Jul 29, 2026Prabhjot Singh, Pritam Deka, Vijay ChennareddySocial Bias in Language ModelsClinical Reasoning

  11. Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

    Jul 29, 2026Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem +10Clinical TriageClinical Decision Support

  12. Cognivia: A Cognitive Behavioral Therapy Copilot for Evidence-Based Mental Healthcare

    Jul 28, 2026Qi Chen, Siria Xiyueyao Luo, Jian Wang +3Mental Health CounselingConversational Agents

  13. CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

    Jul 28, 2026Xiao Li, Mouxiao Bian, Zhaodi Wu +8HealthcareClinical Language Model Evaluation

  14. Guiding Language Models to Be More Empathetic: Culturally Sensitive Mental Health Advice Generation Through Human-LLM Collaboration

    Jul 26, 2026Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman +3Mental Health CounselingLLM Prompting

  15. Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

    Jul 24, 2026Jian Lu, Panyu Chen, Miriam Treggiari +5LLM ReliabilityClinical Language Model Evaluation

  16. MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

    Jul 23, 2026Qian Wu, Xinrong Zhou, Zizhan Ma +8Educational TechnologyClinical Language Model Evaluation

  17. Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

    Jul 22, 2026Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull +2LLM-as-a-JudgeReasoning Evaluation

  18. Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture

    Jul 17, 2026Anabela C. Areias, Catarina Botelho, António Farinhas +7Emotional Support ConversationMental Health

  19. Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

    Jul 14, 2026Monica Munnangi, Saiph SavageMulti-Turn Dialogue EvaluationClinical Language Model Evaluation

  20. Agentic systems for breast cancer treatment recommendations

    Jul 13, 2026Vinicius Anjos de Almeida, Nícolas Henrique Borges, Leonardo Vicenzi +5Multi-Agent LLM SystemsClinical Decision Support

  21. Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

    Jul 13, 2026Yong Yang, Xiang Guan, Sophie Arheix-Parras +7Multimodal Large Language ModelsLanguage Modeling

  22. Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

    Jul 12, 2026Asher Sprigler, Yang-Yang Feng, Iftach Amir +5LLM AlignmentMoral Reasoning in Language Models

  23. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical QALLM Refusal Behavior

  24. Information-seeking failures of large language models in agentic clinical reasoning

    Jul 11, 2026Krischan Braitsch, Laura K. Schmalbrock, Theresa Weltermann +11HealthcareAgentic Reasoning