Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Reliability-Oriented Multilingual Orthopedic Diagnosis: A Domain-Adaptive Modeling and a Conceptual Validation Framework

    May 4, 2026Danish Ali, Li Xiaojian, Sundas Iqbal +1Multilingual Language Model EvaluationHealthcare

  2. What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models

    May 3, 2026Ranit Karmakar, Jayita ChatterjeeLLM EvaluationLanguage Model Calibration

  3. Only Say What You Know: Calibration-Aware Generation for Long-Form Factuality

    May 3, 2026Wen Luo, Guangyue Peng, Liang Wang +7Long-Form Document GenerationLLM Hallucination Mitigation

  4. Geometry-Calibrated Conformal Abstention for Language Models

    Apr 30, 2026Rui Xu, Yi Chen, Sihong Xie +1Uncertainty QuantificationSelective Prediction

  5. LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps

    Apr 30, 2026Keito Inoshita, Xiaokang Zhou, Akira Kawai +1LLM EvaluationAnnotator Disagreement

  6. Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors

    Apr 28, 2026Long Zhang, Zi-bo Qin, Wei-neng ChenKnowledge Conflicts in Language ModelsLLM Auditing

  7. Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning

    Apr 27, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaContinual Learning for LLMsConformal Prediction

  8. Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

    Apr 25, 2026Boqi Chen, Xudong Liu, Yunke Ao +1Visual Question AnsweringLanguage Model Calibration

  9. Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

    Apr 24, 2026Prakul Sunil Hiremath, Harshit R. HiremathConfidence Estimation in Language ModelsCoT Reasoning

  10. Distillation Traps and Guards: A Calibration Knob for LLM Distillability

    Apr 21, 2026Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski +1Language Model CalibrationLanguage Model Distillation

  11. Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA

    Apr 19, 2026Alberto Testoni, Iacer CalixtoHealthcareSocial Bias in Language Models

  12. Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

    Apr 19, 2026Yunkai Dang, Yifan Jiang, Yizhu Jiang +3Selective PredictionConfidence Estimation in Language Models

  13. Beyond Surface Statistics: Robust Conformal Prediction for LLMs via Internal Representations

    Apr 17, 2026Yanli Wang, Peng Kuang, Xiaoyu Han +2Confidence Estimation in Language ModelsConformal Prediction

  14. Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate

    Apr 15, 2026Jaemin Kim, Sungkyun Kim, Junyeol Lee +1LLM QuantizationLanguage Model Calibration

  15. Less Data Approximates More: Earning Faithful Confidence in High-Stakes Domains

    Apr 9, 2026Haokai Ma, Lee Yan Zhen, Gang Yang +4RL for Language ModelsReinforcement Learning

  16. Persona Matters: Effects of Activation Steering on Short Answer Generation and Scoring

    Apr 8, 2026Yongchao Wu, Aron HenrikssonOpen-Ended GenerationLanguage Model Steering

  17. Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

    Apr 2, 2026Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil +1Vision-Language ModelsVLM Hallucination

  18. On Calibration of Large Language Models: From Response To Capability

    Feb 14, 2026Sin-Han Yang, Cheng-Kuang Wu, Chieh-Yen Lin +3LLM EvaluationConfidence Estimation in Language Models

  19. Scalable Delphi: Large Language Models for Structured Risk Estimation

    Feb 9, 2026Tobias Lorenz, Mario FritzLanguage Model Calibration

  20. Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models

    Jan 28, 2026Moule Lin, Shuhao Guan, Andrea Patane +2Bayesian Neural NetworksConfidence Estimation in Language Models