Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

    Sep 14, 2026Laura M. Vowels, Matthew J. Vowels, Shivali Sharma +9LLM Safety BenchmarksMental Health Counseling

  2. MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations

    Sep 14, 2026Youssef Mohamed, Ahmed Heakl, Qinrong Cui +13Medical DiagnosisMulti-Turn Dialogue Evaluation

  3. A primer on evaluation methods for large language models in healthcare

    Sep 13, 2026Suzannah E McKinney, Phuc Vu, Samuel A Justice +7LLM EvaluationClinical Language Model Evaluation

  4. Towards a Deterministic Math Solver for Clinical Language Models

    Sep 12, 2026Felipe Ocampo Osorio, Sebastián Andrés Cajas Ordoñez, Maximin Lange +5Numerical Reasoning in Language ModelsLLM Reliability

  5. Can LLMs Follow Medical Expert Logic? A Benchmark for Hierarchical Logical Consistency in Risk-of-Bias Assessment

    Sep 12, 2026Jiayu Huang, Zichen Tang, Qianhui Ling +2Reasoning Consistency in Language ModelsClinical Language Model Evaluation

  6. Scaling Clinical Judgment to Evaluate Medical AI

    Sep 11, 2026Thomas A. Buckley, Zahir Kanjee, Peter G. Brodeur +15LLM-as-a-JudgeLLM Fine-Tuning

  7. The widening evaluation gap in medical large language model research 2023 to 2026

    Sep 11, 2026Raad Bin Tareaf, Murad Al-Rajab, Samia LoucifLLM EvaluationClinical Language Model Evaluation

  8. Emergency Department Revisit Quality Review Screening: Exploring Human Decision-Making and Artificial Intelligence Support

    Sep 9, 2026Jonathan A. Handler, Marlene I. Robles-Granda, Jacob E. Mefford +5Clinical Decision SupportClinical Decision-Making

  9. Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics

    Sep 8, 2026Andy Nkansah, Hanna Plotnitskaya, Stanislau Salavei +6HealthcareMedical Diagnosis

  10. LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening

    Sep 3, 2026Muhammad Ashad Kabir, Sirajam MuniraMedical DiagnosisIn-Context Learning

  11. Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor

    Sep 2, 2026Rohith Reddy Bellibaltu, Manpreet Singh, Deepak Parashar +1Counterfactual EvaluationAlgorithmic Fairness

  12. Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA

    Sep 1, 2026Nishant Mishra, Ameen Abu-Hanna, Iacer CalixtoClinical Language Model EvaluationLanguage Model Robustness

  13. ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues

    Sep 1, 2026Huimin Wang, Zhengyi Zhao, Yutian ZhaoClinical QAClinical Reasoning

  14. Toward Workflow-Aware Benchmarking for Healthcare NLP Agents

    Aug 31, 2026Junyi Yao, Baichuan Li, Zihao Zheng +1Benchmark DesignLLM Agent Evaluation

  15. ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography

    Aug 31, 2026Mohammadsina Hassannia, Matthew A. Reyna, Reza SameniElectrocardiographyLLM Fine-Tuning

  16. GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

    Aug 31, 2026Boqi Chen, Xudong Liu, Yunke Ao +2HealthcareConstrained RL

  17. Error Detection for PET/CT Radiology Reports: Domain-Specific vs Large Language Models

    Aug 30, 2026Hermione Warr, Harry Anthony, Lilli J Freischem +3LLM EvaluationPET/CT Imaging

  18. Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions

    Aug 13, 2026Qingfang Liu, Qiao Jin, Joe D. Menke +2Clinical QAInformation Retrieval

  19. Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

    Aug 12, 2026Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels +2Energy-Efficient MLLLM Safety Evaluation

  20. Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

    Aug 10, 2026Qingfeng Zhang, Yuanxiong Guo, Yanmin GongLLM Fine-TuningClinical Decision Support

  21. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation

  22. An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

    Aug 10, 2026Mengxian Lyu, Cheng Peng, Tim Jang +18Clinical Decision-MakingDomain Adaptation for LLMs

  23. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

    Aug 10, 2026Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam +1Hallucination in Language ModelsLLM Uncertainty Estimation

  24. RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

    Aug 5, 2026Mouxiao Bian, Zhi Chen, Ruiyao Chen +8LLM Safety BenchmarksHealthcare