Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

    Jun 18, 2026Yuetian Du, Yucheng Wang, Ming Kong +4Multimodal QALanguage Model Calibration

  2. LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data

    Jun 17, 2026Akshat Dasula, Prasanna Desikan, Jaideep SrivastavaLanguage Model CalibrationLLM Uncertainty Estimation

  3. MortarBench: Evaluating Mortgage Loan Origination Agents

    Jun 17, 2026Matthew Toles, Yunan Lu, Manav Munjal +6Financial ServicesLanguage Model Calibration

  4. Rescaling MLM-Head for Neural Sparse Retrieval

    Jun 17, 2026Youngjoon Jang, Seongtae Hong, Jonah Turner +1Masked Language ModelingLearned Sparse Retrieval

  5. Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

    Jun 15, 2026Ali Marashian, Alexis Palmer, Katharina von der WenseConfidence Estimation in Language ModelsLanguage Model Calibration

  6. PromptShift-CRC: Drift-Aware Conformal Risk Control for Foundation Models Under Prompt and Domain Shift

    Jun 14, 2026Jeffery Opoku, David BanaheneConformal PredictionLanguage Model Calibration

  7. Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

    Jun 14, 2026Reza Khanmohammadi, Kundan Thind, Mohammad M. GhassemiVLM EvaluationSelective Prediction

  8. Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

    Jun 12, 2026Daniel Lee, Harsh Sharma, Eunkyu Park +5LLM-as-a-JudgeLanguage Model Calibration

  9. Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

    Jun 9, 2026Maria Milkova, Maksim RudnevSoft-Label LearningLLM-Assisted Annotation

  10. TRIAGE: Dialectical LLM Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series

    Jun 8, 2026Hyeongwon Jang, Gyouk Chu, Changhun Kim +4Irregular Time-Series ModelingLogical Reasoning

  11. From Hazard Functions to Language Space: Cox-Supervised Distillation of Survival Risk into a Large Language Model

    Jun 8, 2026Nicholas I-Hsien Kuo, Blanca Gallego, Louisa JormSurvival AnalysisLanguage Model Calibration

  12. Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method

    Jun 6, 2026Kyoungmin Kim, Martin Catheland, Anastasia AilamakiSemantic SearchLLM Inference Acceleration

  13. From 'May' to 'Is': Certainty Distortion in Language Model Rewriting

    Jun 6, 2026Catarina G Belem, Shang Wu, Hongyu Yao +3Scientific CommunicationLanguage Model Calibration

  14. Sycophantic Praise: Evaluating Excessive Praise in Language Models

    Jun 5, 2026Daniel Vennemeyer, Phan Anh Duong, Meryl Ye +2LLM EvaluationLLM Sycophancy

  15. FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

    Jun 4, 2026Haoyu Huang, Linlin Yang, Sheng Xu +5LLM QuantizationDiffusion Model Quantization

  16. CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction

    Jun 4, 2026Mohammad Anas Jawad, Cornelia CarageaConfidence Estimation in Language ModelsLanguage Model Calibration

  17. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge

  18. Conformal Language Modeling via Posterior Sampling

    Jun 2, 2026Nicolas Emmenegger, Theo X. Olausson, Armando Solar-Lezama +1Hallucination in Language ModelsConformal Prediction

  19. Large Language Models Are Overconfident in Their Own Responses

    Jun 2, 2026Mario Sanz-Guerrero, Manuel Mager, Katharina von der WenseConfidence Estimation in Language ModelsLLM Prompting

  20. Evidence-Gated LLM Priors for Multi-Objective Bayesian Optimization

    Jun 1, 2026Jiangyu Chen, Ban YiBayesian OptimizationLarge Language Model-Guided Optimization