Clinical Language Model Evaluation

Latest papers 258

All topics
CardsList
  1. Large language models are vulnerable to incidental information in clinical documentation and reasoning

    Oct 6, 2026Krithik Vishwanath, Brandon Ye, Anton Alyakin +4Medical Report GenerationClinical Language Model Evaluation

  2. Language-model ratings of depression reflect the rater more than the patient

    Oct 6, 2026Baihan LinInter-Rater ReliabilityAnnotator Disagreement

  3. COMPASS 2.0: psychometric representational similarity analysis distinguishes symptom structure from personal signal

    Oct 5, 2026Baihan LinRepresentational Similarity AnalysisPsychometric Validation

  4. Clinical Concept Centers in LLMs

    Oct 2, 2026Aishik Nagar, Abhishek Vaidyanathan, Arun-Kumar Kaliya-Perumal +2Mechanistic InterpretabilityCausal Interventions in Language Models

  5. Counterfactual Auditing of Bias in Open-Source Large Language Models for Clinical Triage

    Oct 1, 2026Manar Aljohani, Brandon Ho, Kenneth McKinley +2Clinical Decision-MakingLanguage Model Bias Evaluation

  6. A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined

    Oct 1, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoFaithfulness of Language Model ExplanationsTemporal Reasoning in Language Models

  7. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1LLM Safety BenchmarksLLM Auditing

  8. UniBuc at SemEval-2024 Task 2: Tailored Prompting with Solar for Clinical NLI

    Sep 30, 2026Marius Micluta-Campeanu, Claudiu Creanga, Ana-Maria Bucur +2Clinical Language Model EvaluationClinical NLP

  9. Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts

    Sep 29, 2026Abinitha Gourabathina, Haoran Zhang, Yuexing Hao +2Clinical TriageClinical Decision-Making

  10. MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models

    Sep 29, 2026Lukas Thede, Yash Kumar Atri, David Chen +4Continual Learning for LLMsFactual Knowledge in Language Models

  11. KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

    Sep 29, 2026Xueting Fang, Zehui Li, Yang Yang +5Clinical Decision-MakingMulti-Turn Dialogue Evaluation

  12. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoClinical ReasoningRubric-Based Evaluation

  13. Understanding Clinical Cognitive Dialogues Using Large Language Models

    Sep 28, 2026Vishalakshi Arumugam, Dan Schumacher, Veronica Rammouz +3Intent ClassificationMulti-Turn Dialogue Evaluation

  14. Jev in Medicine: A Benchmark Evaluation

    Sep 27, 2026Alfredo Madrid-García, Beatriz Merino-BarbanchoMedical QAClinical Reasoning

  15. OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories

    Sep 26, 2026Anqi Li, Zhixuan Ge, Yixuan Duan +9Clinical Decision-MakingOncology

  16. A Living Benchmark for Information Retrieval from Electronic Health Records

    Sep 24, 2026Jordan L. Cahoon, Chloe O. Stanwyck, Sulaiman Somani +23Synthetic Benchmark GenerationClinical QA

  17. Language Specificity vs. Domain Diversity: Benchmarking Transformers for Bangla Medical NER

    Sep 24, 2026Rakib Abdullah, Md. Maruful Islam MarufNamed Entity RecognitionMultilingual Language Model Evaluation

  18. Misaligned Clinical Risk Classification and Cost Asymmetry in Open-Weight Large Language Models

    Sep 21, 2026Star S. D. Liu, Xiyu Ding, Robert B. Barrett +3Cost-Sensitive LearningLLM Interpretability

  19. LLMs Anchor on Chief Complaint and Fail to Integrate Evidence in Sequential Clinical Triage

    Sep 19, 2026Dipankar Srirag, Haokai Zhao, Ashutosh Kumar +6Clinical TriageClinical Reasoning

  20. HerHealthEval: Evaluating Multilingual and Register-Sensitive Understanding of Women's Health Communication

    Sep 17, 2026Hassan Saeed Hassan Albattra, Mazen Mohammed Bahgat, Rahatara Ferdousi +2Multilingual Language Model EvaluationHealthcare

  21. Japanese Stroke LLM Evaluation: A Conversational Benchmark for Safe Stroke Care in Japanese Using Large Language Models

    Sep 15, 2026Keisuke Masuda, Kazutaka Yatsushiro, Hirohumi Iwamoto +2LLM Safety BenchmarksHealthcare

  22. Challenges of Auditing: Variability in Outputs of Large Language Models for Health

    Sep 15, 2026Yuan Pu, Yewon Chang, Furong Jia +4LLM EvaluationLLM Auditing

  23. Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

    Sep 14, 2026Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah +1LLM GroundingLLM Answer Verification

  24. K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

    Sep 14, 2026Laura M. Vowels, Matthew J. Vowels, Shivali Sharma +9LLM Safety BenchmarksMental Health Counseling

  25. MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations

    Sep 14, 2026Youssef Mohamed, Ahmed Heakl, Qinrong Cui +13Medical DiagnosisMulti-Turn Dialogue Evaluation

  26. A primer on evaluation methods for large language models in healthcare

    Sep 13, 2026Suzannah E McKinney, Phuc Vu, Samuel A Justice +7LLM EvaluationClinical Language Model Evaluation

  27. Towards a Deterministic Math Solver for Clinical Language Models

    Sep 12, 2026Felipe Ocampo Osorio, Sebastián Andrés Cajas Ordoñez, Maximin Lange +5Numerical Reasoning in Language ModelsLLM Reliability

  28. Can LLMs Follow Medical Expert Logic? A Benchmark for Hierarchical Logical Consistency in Risk-of-Bias Assessment

    Sep 12, 2026Jiayu Huang, Zichen Tang, Qianhui Ling +2Reasoning Consistency in Language ModelsClinical Language Model Evaluation

  29. Scaling Clinical Judgment to Evaluate Medical AI

    Sep 11, 2026Thomas A. Buckley, Zahir Kanjee, Peter G. Brodeur +15LLM-as-a-JudgeLLM Fine-Tuning

  30. The widening evaluation gap in medical large language model research 2023 to 2026

    Sep 11, 2026Raad Bin Tareaf, Murad Al-Rajab, Samia LoucifLLM EvaluationClinical Language Model Evaluation

  31. Emergency Department Revisit Quality Review Screening: Exploring Human Decision-Making and Artificial Intelligence Support

    Sep 9, 2026Jonathan A. Handler, Marlene I. Robles-Granda, Jacob E. Mefford +5Clinical Decision SupportClinical Decision-Making

  32. Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics

    Sep 8, 2026Andy Nkansah, Hanna Plotnitskaya, Stanislau Salavei +6HealthcareMedical Diagnosis

  33. LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening

    Sep 3, 2026Muhammad Ashad Kabir, Sirajam MuniraMedical DiagnosisIn-Context Learning

  34. Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor

    Sep 2, 2026Rohith Reddy Bellibaltu, Manpreet Singh, Deepak Parashar +1Counterfactual EvaluationAlgorithmic Fairness

  35. Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA

    Sep 1, 2026Nishant Mishra, Ameen Abu-Hanna, Iacer CalixtoClinical Language Model EvaluationLanguage Model Robustness

  36. ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues

    Sep 1, 2026Huimin Wang, Zhengyi Zhao, Yutian ZhaoClinical QAClinical Reasoning

  37. Toward Workflow-Aware Benchmarking for Healthcare NLP Agents

    Aug 31, 2026Junyi Yao, Baichuan Li, Zihao Zheng +1Benchmark DesignLLM Agent Evaluation

  38. ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography

    Aug 31, 2026Mohammadsina Hassannia, Matthew A. Reyna, Reza SameniElectrocardiographyLLM Fine-Tuning

  39. GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

    Aug 31, 2026Boqi Chen, Xudong Liu, Yunke Ao +2HealthcareConstrained RL

  40. Error Detection for PET/CT Radiology Reports: Domain-Specific vs Large Language Models

    Aug 30, 2026Hermione Warr, Harry Anthony, Lilli J Freischem +3LLM EvaluationPET/CT Imaging

  41. Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions

    Aug 13, 2026Qingfang Liu, Qiao Jin, Joe D. Menke +2Clinical QAInformation Retrieval

  42. Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

    Aug 12, 2026Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels +2Energy-Efficient MLLLM Safety Evaluation

  43. Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

    Aug 10, 2026Qingfeng Zhang, Yuanxiong Guo, Yanmin GongLLM Fine-TuningClinical Decision Support

  44. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation

  45. An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

    Aug 10, 2026Mengxian Lyu, Cheng Peng, Tim Jang +18Clinical Decision-MakingDomain Adaptation for LLMs

  46. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

    Aug 10, 2026Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam +1Hallucination in Language ModelsLLM Uncertainty Estimation

  47. RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

    Aug 5, 2026Mouxiao Bian, Zhi Chen, Ruiyao Chen +8LLM Safety BenchmarksHealthcare

  48. CARE-Bench: Benchmarking Patient-Facing LLM Triage

    Aug 4, 2026Yining Hua, Hongbin Na, Cyrus AyubchaLLM Safety BenchmarksClinical Triage