Clinical Language Model Evaluation

Latest papers 259

All topics
CardsList
  1. Continued Pretraining of FinBERT on Finnish Histopathological Reports: Train-Time Signals and Proxy Downstream Correlations

    Apr 16, 2026Rami Luisto, Liisa Petäinen, Tommi Grönholm +5HealthcareDomain-Adaptive Pretraining

  2. SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

    Jan 23, 2026Dongshen Peng, Yi Wang, Austin Schoeffler +5LLM SycophancyLanguage Model Safety Evaluation

  3. MAPLE: Medical Aspect-Based Summarization with Phrase-Level Evidence

    Jan 6, 2026Bohao Chu, Hendrik Damm, Tabea M. G. Pakull +5HealthcareText Summarization

  4. Context-Aware Classification and Grading of Sensitive Information in Online Conversational Health Data

    Dec 25, 2025Yiwei Yan, Guanfeng LiuHealthcareText Classification

  5. MedRECT: A Bilingual Medical Reasoning Benchmark for Error Correction in Clinical Texts

    Nov 1, 2025Naoto Iwase, Hiroki Okuyama, Junichiro IwasawaMultilingual Language Model EvaluationHealthcare

  6. Zoom In Disparities in Healthcare LLM Q&A

    Oct 20, 2025Ipek Baris Schlicht, Burcu Sayin, Zhixue Zhao +5Multilingual Language Model EvaluationKnowledge Augmentation for Language Models

  7. Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

    Aug 5, 2025Shintaro Sakai, Jisun An, Migyeong Kang +1Mental HealthCultural Bias in Language Models

  8. Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications

    Aug 1, 2025Zizhan Ma, Wenxuan Wang, Meidan Ding +7LLM PromptingRL for Language Model Reasoning

  9. HarmReduction: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

    Jul 29, 2025Kaixuan Wang, Chenxin Diao, Jason T. Jacques +2HealthcareQuestion Answering

  10. Structured Prompting and Automated Evaluation in Fixed Synthetic Japanese-Language Counseling Dialogues

    Jun 28, 2025Keita Kiuchi, Yoshikazu Fujimoto, Hideyuki Goto +5Mental Health CounselingLLM-as-a-Judge

  11. Therapy as an NLP Task: Comparing LLMs and Human Peers Behaviors in CBT Sessions

    Sep 3, 2024Zainab Iftikhar, Sean Ransom, Amy Xiao +2Mental Health CounselingConversational Agents

  12. "Mirror" Large Language Model Evaluations of Depression are Criterion Contaminated

    Date pendingTong Li, Rasiq Hussain, Mehak Gupta +1Depression DetectionMental Health

  13. Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation

    Date pendingZhiyao Ren, Yibing Zhan, Siyuan Liang +3HealthcareClinical Reasoning

  14. VeriSim: A Configurable Framework for Stress-Testing Medical AI Under Patient Communication Noise

    Date pendingSina Mansouri, Mohit Marvania, Vibhavari Ashok Shihorkar +5HealthcareLLM Reliability

  15. Expert-Level Crisis Detection in Mental Health Conversations

    Date pendingGrace Byun, Abigail Lott, Rebecca Lipschutz +3Mental HealthSuicide Risk Modeling