Language Model Calibration

Latest papers 247

All topics
CardsList
  1. LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data

    Jun 17, 2026Akshat Dasula, Prasanna Desikan, Jaideep SrivastavaLanguage Model CalibrationLLM Uncertainty Estimation

  2. MortarBench: Evaluating Mortgage Loan Origination Agents

    Jun 17, 2026Matthew Toles, Yunan Lu, Manav Munjal +6Financial ServicesLanguage Model Calibration

  3. Rescaling MLM-Head for Neural Sparse Retrieval

    Jun 17, 2026Youngjoon Jang, Seongtae Hong, Jonah Turner +1Masked Language ModelingLearned Sparse Retrieval

  4. Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

    Jun 15, 2026Ali Marashian, Alexis Palmer, Katharina von der WenseConfidence Estimation in Language ModelsLanguage Model Calibration

  5. PromptShift-CRC: Drift-Aware Conformal Risk Control for Foundation Models Under Prompt and Domain Shift

    Jun 14, 2026Jeffery Opoku, David BanaheneConformal PredictionLanguage Model Calibration

  6. Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

    Jun 14, 2026Reza Khanmohammadi, Kundan Thind, Mohammad M. GhassemiVLM EvaluationSelective Prediction

  7. Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

    Jun 12, 2026Daniel Lee, Harsh Sharma, Eunkyu Park +5LLM-as-a-JudgeLanguage Model Calibration

  8. Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

    Jun 9, 2026Maria Milkova, Maksim RudnevSoft-Label LearningLLM-Assisted Annotation

  9. TRIAGE: Dialectical LLM Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series

    Jun 8, 2026Hyeongwon Jang, Gyouk Chu, Changhun Kim +4Irregular Time-Series ModelingLogical Reasoning

  10. From Hazard Functions to Language Space: Cox-Supervised Distillation of Survival Risk into a Large Language Model

    Jun 8, 2026Nicholas I-Hsien Kuo, Blanca Gallego, Louisa JormSurvival AnalysisLanguage Model Calibration

  11. Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method

    Jun 6, 2026Kyoungmin Kim, Martin Catheland, Anastasia AilamakiSemantic SearchLLM Inference Acceleration

  12. From 'May' to 'Is': Certainty Distortion in Language Model Rewriting

    Jun 6, 2026Catarina G Belem, Shang Wu, Hongyu Yao +3Scientific CommunicationLanguage Model Calibration

  13. Sycophantic Praise: Evaluating Excessive Praise in Language Models

    Jun 5, 2026Daniel Vennemeyer, Phan Anh Duong, Meryl Ye +2LLM EvaluationLLM Sycophancy

  14. FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

    Jun 4, 2026Haoyu Huang, Linlin Yang, Sheng Xu +5LLM QuantizationDiffusion Model Quantization

  15. CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction

    Jun 4, 2026Mohammad Anas Jawad, Cornelia CarageaConfidence Estimation in Language ModelsLanguage Model Calibration

  16. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge

  17. Conformal Language Modeling via Posterior Sampling

    Jun 2, 2026Nicolas Emmenegger, Theo X. Olausson, Armando Solar-Lezama +1Hallucination in Language ModelsConformal Prediction

  18. Large Language Models Are Overconfident in Their Own Responses

    Jun 2, 2026Mario Sanz-Guerrero, Manuel Mager, Katharina von der WenseConfidence Estimation in Language ModelsLLM Prompting

  19. Evidence-Gated LLM Priors for Multi-Objective Bayesian Optimization

    Jun 1, 2026Jiangyu Chen, Ban YiBayesian OptimizationLarge Language Model-Guided Optimization

  20. Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents

    Jun 1, 2026Aitor Arronte Alvarez, Naiyi Xie FinchamIntelligent Tutoring SystemsSocial Bias in Language Models

  21. Low-Resource Safety Failures Are Action Failures, Not Representation Failures

    May 31, 2026Rashad Aziz, Ikhlasul Akmal Hanif, Fajri KotoLanguage Model CalibrationLLM Safety

  22. A Finite-Calibration Regime Map for LLM Judge Panels

    May 31, 2026Bin Zhu, Yanghui RaoLLM-as-a-JudgeLanguage Model Calibration