Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

    Jul 10, 2026Runhan Shi, Quan Zhou, Yuqian Xu +14HealthcareClinical Language Model Evaluation

  2. The complexities of patient-centred conversational artificial intelligence

    Jul 9, 2026João Matos, Olivia Buege, Donny Cheung +8Clinical TriageConversational Agents

  3. MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters

    Jul 9, 2026Yuming Yang, Xiao Sun, Yuanwei Zou +6Mental HealthClinical Reasoning

  4. Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

    Jul 8, 2026Qi Peng, Jiatong Li, Sirui Huang +10Clinical ReasoningClinical Language Model Evaluation

  5. Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

    Jul 7, 2026Tamara Wit, Lifeng Han, Carly Heipon +3Privacy-Preserving Language ModelsSmall Language Models

  6. Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

    Jul 4, 2026Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard +4Bayesian OptimizationLarge Language Model-Guided Optimization

  7. Where do LLMs Fall Short in CBT-Guided Affective Reasoning?

    Jul 3, 2026Vaishnavi Sinha, Pooja Guttal, Pranay Deep Reddy Katike +5Mental HealthClinical Language Model Evaluation

  8. A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

    Jul 2, 2026Samiha A. Ismail, Fan X. Chen, Ali MeraliClinical Decision-MakingClinical Reasoning

  9. Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention

    Jul 1, 2026William Philipp, Finn Fassbender, Daniel Fister +12Multilingual Language Model EvaluationLLM-as-a-Judge

  10. CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

    Jun 30, 2026Ajmal M., Abin Roy, Afthab Salam Kanniyan +4LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  11. Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

    Jun 29, 2026Mizanur Rahman, Abeer Badawi, Elahe Rahimi +4Mental Health CounselingMulti-Agent LLM Systems

  12. Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency

    Jun 29, 2026Nisarg A. PatelLLM EvaluationReasoning Consistency in Language Models

  13. The strength of clinical evidence is recoverable from language model representations but not from their stated grades

    Jun 27, 2026Soroosh Tayebi ArastehLLM InterpretabilityLanguage Model Calibration

  14. Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries

    Jun 27, 2026Jean Feng, Vishal Patel, Patrick Heagerty +5Clinical Decision SupportClinical QA

  15. MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

    Jun 24, 2026Congbo Ma, Hu Wang, Yichun Zhang +1LLM GuardrailsLLM Safety

  16. MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

    Jun 23, 2026Jinru Ding, Chuchu Jiang, Lu Lu +12AI Agent BenchmarksMedical VLMs

  17. One Year Later...The Harms Persist, But So Do We!

    Jun 22, 2026Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar +1Mental HealthAdversarial Attacks on LLMs

  18. Self-Stigma Is Not a Monolith, but Generic Empathy Is: Persona-Conditioned LLM Support for People Who Use Drugs

    Jun 22, 2026Layla Bouzoubaa, Rezvaneh RezapourHealthcareUser Modeling

  19. MedHal-Loc: Are "Explainable-by-Architecture" Medical Hallucination Detectors Faithful Localizers? A Localization Benchmark

    Jun 19, 2026Minmin Chen, Daojian Lu, Yining Dai +2Hallucination DetectionClinical Language Model Evaluation

  20. A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening

    Jun 19, 2026Jingchen Ye, Yanpei Yu, Luyao ZhangLLM AuditingLLM Interpretability

  21. LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data

    Jun 17, 2026Akshat Dasula, Prasanna Desikan, Jaideep SrivastavaLanguage Model CalibrationLLM Uncertainty Estimation

  22. Trade-offs in Medical LLM Adaptation: An Empirical Study in French QA

    Jun 17, 2026Ikram Belmadani, Oumaima El Khettari, Carlos Ramisch +3LLM Fine-TuningDomain-Adaptive Pretraining

  23. Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

    Jun 17, 2026Qingyu Lu, Ruochen Li, Liang Ding +3Clinical Language Model EvaluationLanguage Model Robustness

  24. Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

    Jun 17, 2026Tianming Du, Peijie Yu, Sihan Shang +12AI Agent BenchmarksClinical Language Model Evaluation