Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark

    Sep 23, 2026Makar Ulesov, Vladislav Smirnov, Omar Ibrahim +1Benchmark AuditingLLM Auditing

  2. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLLM EvaluationConfidence Estimation in Language Models

  3. How to Estimate Whether You Have Found Several Needles in a Haystack: Measuring Calibration in Multi-Label Text Classification

    Sep 22, 2026Sophie Henning, Georg Hofmann, Alexander Schulte +2Multi-Label ClassificationLanguage Model Calibration

  4. Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models

    Sep 21, 2026Kevin David Hayes, Arka Pal, Haosong Zhang +2Language Model Error DetectionConfidence Estimation in Language Models

  5. Evaluating Decision Models for Text Annotation in Computational Social Science

    Sep 21, 2026Hazem Ibrahim, Yasir ZakiLLM EvaluationLLM-Assisted Annotation

  6. SupportCal: Label-Free Calibration of Post-Trained LLMs via Reference Support and Corroboration

    Sep 21, 2026Linhan Luo, Lequan Lin, Dai Shi +3Post-Hoc CalibrationLanguage Model Calibration

  7. R2VC: Modular Fact-Checking with Retrieval, Verification, and Confidence Calibration

    Sep 14, 2026Dhruv Dixit, Paritosh PandeyRetrieval-Augmented GenerationAutomated Fact-Checking

  8. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  9. TriCalRAG: A Three-Strategy, Retrieval-Augmented Benchmark for On-Premise LLM-Based Root Cause Analysis in AIOps

    Sep 13, 2026Rohit Patel, Susil Kumar Mohanty, Jeenal ChaudharyLLM Inference EfficiencyRetrieval-Augmented Generation

  10. ProbPlug: A Plugin Uncertainty Network for Reliable Confidence in LLM Binary Classification

    Sep 9, 2026Jianzong Wang, Chuhang Liu, Botao Zhao +6Confidence Estimation in Language ModelsLanguage Model Calibration

  11. Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format

    Sep 9, 2026Touchapon Kraisingkorn, Krittin Pachtrachai, Wachiravit ModecruaLLM EvaluationLanguage Model Calibration

  12. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

    Sep 1, 2026Kangjia Zhao, Jiajun Li, Haozhan Shen +8Tool-Use EvaluationLLM Agent Evaluation

  13. DualStake: Dual-Path Confidence Calibration in Deep Research Agents

    Sep 1, 2026Yinuo Xu, Yuwei Liang, Jianjie Cheng +4Deep Research AgentsLanguage Model Calibration

  14. Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

    Aug 31, 2026Qiyao Yan, Chenpeng Wang, Liangming PanLLM EvaluationLanguage Model Calibration

  15. Calibrating Small Language Models for Claim Check-Worthiness Detection

    Aug 31, 2026Pratuat Amatya, V Venktesh, Vinay SettyClaim VerificationSmall Language Models

  16. CoMPASS: Collaborative Molecular Property Prediction via Adaptive Small-Large Model Synergy

    Aug 31, 2026Wentao Li, Jiangjie Qiu, Yijun Li +2Graph Neural NetworksLanguage Model Calibration

  17. Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection

    Aug 18, 2026Bin Li, Dongdong Wang, Siyang LuPost-Hoc CalibrationOnline Anomaly Detection

  18. Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

    Aug 13, 2026Irina Proskurina, Mayank Kumar, Oyindolapo O. KomolafeConfidence Estimation in Language ModelsQuestion Answering

  19. ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

    Aug 11, 2026Md Rabiul Islam, Samir Abdaljalil, Erchin Serpedin +1Selective PredictionClinical Decision Support

  20. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration