Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

    May 15, 2026Weixin Liu, Congning Ni, Shelagh A. Mulvaney +4LLM EvaluationHealthcare

  2. Quantifying and Mitigating Premature Closure in Frontier LLMs

    May 14, 2026Rebecca Handler, Suhana Bedi, Nigam ShahHealthcareLLM Prompting

  3. RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

    May 14, 2026Shuhao Chen, Weisen Jiang, Changmiao Wang +4HealthcareClinical Decision Support

  4. Patients With Personality: Realistic Patient Simulation through Controlled Diversity and Selective Disclosure

    May 13, 2026Moritz Schlager, Friederike Jungmann, Samuel Schmidgall +12Personality Modeling in Language ModelsPersona-Conditioned Generation

  5. RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

    May 13, 2026Chengzhi Shen, Weixiang Shen, Tobias Susetzky +8HealthcareClinical Decision-Making

  6. VERA-MH: Validation of Ethical and Responsible AI in Mental Health

    May 13, 2026Luca Belli, Kate H. Bentley, Josh Gieringer +6HealthcareMental Health

  7. Large Language Models Lack Temporal Awareness of Medical Knowledge

    May 13, 2026Zihan Guan, Qiao Jin, Guangzhi Xiong +6HealthcareTemporal Reasoning in Language Models

  8. Simulating Eating Disorder Patients with LLMs: Evaluating Psychological Persona Stability in Multi-Turn Conversations

    May 12, 2026Jennifer Haase, Jana Gonnermann-Müller, See Heng Yim +3Persona ConsistencyPersonality Modeling in Language Models

  9. AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment

    May 12, 2026Robin Linzmayer, Georgianna Lin, Di Coneybeare +22HealthcareClinical Triage

  10. CPEMH: An Agentic Framework for Prompt-Driven Behavior Evaluation and Assurance in Foundation-Model Systems for Mental Health Screening

    May 11, 2026Giuliano Lorenzoni, Ivens Portugal, Paulo Alencar +1LLM AuditingPrompt Optimization

  11. Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

    May 11, 2026Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada +7LLM AuditingMultimodal Large Language Models

  12. Can We Trust LLMs for Mental Health Screening? Consistency, ASR Robustness, and Evidence Faithfulness

    May 10, 2026Erfan Loweimi, Sofia de la Fuente Garcia, Samira Loveymi +2HealthcareMental Health

  13. CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics

    May 10, 2026Aishik Nagar, Arun-Kumar Kaliya-Perumal, Yu-Hsuan Han +5HealthcareClinical Decision Support

  14. Can Revealed Preferences Clarify LLM Alignment and Steering?

    May 8, 2026Khurram Yamin, Jingjing Tang, Eric Horvitz +1Language Model SteeringLLM Decision-Making

  15. Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?

    May 8, 2026Natalie Seah, Danielle S. Bitterman, Daphna Spiegel +1Breast CancerHealthcare

  16. Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction

    May 7, 2026Shivali Dalmia, Ananya Mantravadi, Prasanna DesikanDocument Information ExtractionClinical Information Extraction

  17. TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

    May 7, 2026Junkai Li, Yunghwei Lai, Tianyi Zhu +3LLM Self-RefinementHealthcare

  18. Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

    May 6, 2026Oriana Presacan, Andreea Grama, Larisa Irimină +6Selective PredictionHealthcare

  19. Self-Prompting Small Language Models for Privacy-Sensitive Clinical Information Extraction

    May 5, 2026Yao-Shun Chuang, Tushti Mody, Uday Pratap Singh +6Named Entity RecognitionHealthcare

  20. Safety and accuracy follow different scaling laws in clinical large language models

    May 5, 2026Sebastian Wind, Tri-Thien Nguyen, Jeta Sopa +9LLM Safety BenchmarksRetrieval-Augmented Generation

  21. EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage

    May 5, 2026Richard J. Young, Alice M. MatthewsGender Bias in Language ModelsClinical Triage

  22. Atomic Fact-Checking Increases Clinician Trust in Large Language Model Recommendations for Oncology Decision Support: A Randomized Controlled Trial

    May 5, 2026Lisa C. Adams, Linus Marx, Erik Thiele Orberg +8HealthcareClinical Decision Support

  23. BIT.UA-AAUBS at ArchEHR-QA 2026: Evaluating Open-Source and Proprietary LLMs via Prompting in Low-Resource QA

    May 5, 2026Richard A. A. Jonker, Alexander Christiansen, Alexandros Maniatis +4LLM GroundingHealthcare

  24. ADAPTS: Agentic Decomposition for Automated Protocol-agnostic Tracking of Symptoms

    May 4, 2026Alexandria K. Vail, Marcelo Cicconet, Katie Aafjes-van Doorn +2Depression DetectionMental Health

  25. Reliability-Oriented Multilingual Orthopedic Diagnosis: A Domain-Adaptive Modeling and a Conceptual Validation Framework

    May 4, 2026Danish Ali, Li Xiaojian, Sundas Iqbal +1Multilingual Language Model EvaluationHealthcare

  26. PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments

    May 4, 2026Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler +10HealthcareLong-Horizon Agent Evaluation

  27. Artificial intelligence language technologies in multilingual healthcare: Grand challenges ahead

    May 2, 2026Vicent Briva-IglesiasMultilingual Language Model EvaluationLanguage Model Safety Evaluation