Language Model Calibration

Latest papers 247

All topics
CardsList
  1. TypedBench: A Benchmark for Calibration, Framing Sensitivity, and Cost in System One Decision Models

    Oct 8, 2026Rahul Sharma, Andrew B. Ducan, Gaétan Marceau Caron +1LLM Decision-MakingLanguage Model Calibration

  2. RL-ARC: Calibrating Large Reasoning Models via Reasoning-guided Uncertainty

    Oct 8, 2026Gukhyeon Lee, SangKeun LeeLanguage Model CalibrationLLM Uncertainty Estimation

  3. System Switch: When Should a Fast Decision Model Stop and Think?

    Oct 7, 2026Gian Luca BailoLLM Decision-MakingSelective Prediction

  4. Language-model ratings of depression reflect the rater more than the patient

    Oct 6, 2026Baihan LinInter-Rater ReliabilityAnnotator Disagreement

  5. JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications

    Oct 5, 2026Steven Denney, Matthew DiGiuseppeLLM EvaluationComputational Social Science

  6. Cross-lingual Calibration of Pre-Generation Success Probes for Multilingual LLM Routing

    Oct 5, 2026Andrea Paganelli, Stefano Civelli, Pietro Bernardelle +1Confidence Estimation in Language ModelsLanguage Model Calibration

  7. Counting Moves, Weighing Voices: Bayesian Dialectical Argumentation for Calibrated Multi-LLM Councils under Persistent Adversaries

    Oct 1, 2026Ionel Eduard Stan, Paolo NapoletanoLanguage Model CalibrationComputational Argumentation

  8. HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix

    Oct 1, 2026Zirui He, Haiyan Zhao, Jingyu Hu +5Language Model SteeringLanguage Model Calibration

  9. AnyJev Technical Report

    Sep 30, 2026Jiamu Zhang, Tianze Yang, Yucheng Shi +6Multiple-Choice Question AnsweringLanguage Model Calibration

  10. Evaluating Persistent Calibration under Evolving Model Knowledge

    Sep 30, 2026Victor Wang, Thomas Hofweber, Mohit Bansal +1Language Model Calibration

  11. Probability is Not Enough: Exploring and Counting Divergent Tokens for Reasoning Uncertainty Quantification in LLMs

    Sep 29, 2026Feiyang Li, Shengjing Liu, Qi Zhan +7Uncertainty QuantificationConfidence Estimation in Language Models

  12. Evaluating and Benchmarking the System One Model Jev

    Sep 29, 2026Tobias Deußer, Lorenz Sparrenberg, Rafet SifaMultilingual Language Model EvaluationLLM Evaluation

  13. Persona Dosing: Calibrated Activation Steering for Graded Trait Control

    Sep 28, 2026Zehao Jin, Junran Wang, Ruixuan Deng +4Language Model SteeringPersonality Modeling in Language Models

  14. IMC-CLINIC: Coupled Loss-Informed Newton Iterations for Clipping in Analog In-Memory Computing

    Sep 28, 2026Yung-Chin Chen, Chia-Yu Chen, Naveen VermaLLM QuantizationCompute-in-Memory

  15. TRACE: Single-Pass Decoding-Trace Risk Localization for Generation Calibration

    Sep 28, 2026Yuebin Xu, Xuemei Peng, Junlan Chen +2Confidence Estimation in Language ModelsLanguage Model Calibration

  16. Jailbreaks for Black-Box Uncertainty Quantification in Large Reasoning Models

    Sep 28, 2026Lucas Biechy, Cédric Eichler, Adrien Boiret +1Language Model CalibrationLLM Uncertainty Estimation

  17. Beyond Verbalized Confidence: Calibrating Reasoners with Differentiable Readouts

    Sep 28, 2026Chenxiao Fan, Chongming Gao, Gangyi Zhang +8Confidence Estimation in Language ModelsRL for Language Model Reasoning

  18. LLMs learn different forms of metacognition when trained to predict their own accuracy

    Sep 27, 2026Nicolas Yax, Stefano Palminteri, Pierre-Yves OudeyerConfidence Estimation in Language ModelsLanguage Model Calibration

  19. Shared Experience, Separate Learning: Companion Confidence Calibration for LLMs

    Sep 27, 2026Shiyu Ni, Keping Bi, Jiafeng Guo +4Confidence Estimation in Language ModelsLanguage Model Calibration

  20. Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models

    Sep 27, 2026Yadong Xi, Rongsheng Zhang, Tangjie Lv +2Confidence Estimation in Language ModelsLanguage Model Calibration

  21. CORDIAL: Calibrating Ordinal LLM Outputs from Few Labels

    Sep 24, 2026Xiangwei Wang, Peng Wang, Saman HalgamugeLanguage Model Calibration

  22. Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams

    Sep 24, 2026Ali Habibullah, Yazan Alshoibi, Mohammad Alshiekh +2Prompt SensitivityLLM-as-a-Judge

  23. Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark

    Sep 23, 2026Makar Ulesov, Vladislav Smirnov, Omar Ibrahim +1Benchmark AuditingLLM Auditing

  24. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLLM EvaluationConfidence Estimation in Language Models

  25. How to Estimate Whether You Have Found Several Needles in a Haystack: Measuring Calibration in Multi-Label Text Classification

    Sep 22, 2026Sophie Henning, Georg Hofmann, Alexander Schulte +2Multi-Label ClassificationLanguage Model Calibration

  26. Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models

    Sep 21, 2026Kevin David Hayes, Arka Pal, Haosong Zhang +2Language Model Error DetectionConfidence Estimation in Language Models

  27. Evaluating Decision Models for Text Annotation in Computational Social Science

    Sep 21, 2026Hazem Ibrahim, Yasir ZakiLLM EvaluationLLM-Assisted Annotation

  28. SupportCal: Label-Free Calibration of Post-Trained LLMs via Reference Support and Corroboration

    Sep 21, 2026Linhan Luo, Lequan Lin, Dai Shi +3Post-Hoc CalibrationLanguage Model Calibration

  29. R2VC: Modular Fact-Checking with Retrieval, Verification, and Confidence Calibration

    Sep 14, 2026Dhruv Dixit, Paritosh PandeyRetrieval-Augmented GenerationAutomated Fact-Checking

  30. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  31. TriCalRAG: A Three-Strategy, Retrieval-Augmented Benchmark for On-Premise LLM-Based Root Cause Analysis in AIOps

    Sep 13, 2026Rohit Patel, Susil Kumar Mohanty, Jeenal ChaudharyLLM Inference EfficiencyRetrieval-Augmented Generation

  32. ProbPlug: A Plugin Uncertainty Network for Reliable Confidence in LLM Binary Classification

    Sep 9, 2026Jianzong Wang, Chuhang Liu, Botao Zhao +6Confidence Estimation in Language ModelsLanguage Model Calibration

  33. Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format

    Sep 9, 2026Touchapon Kraisingkorn, Krittin Pachtrachai, Wachiravit ModecruaLLM EvaluationLanguage Model Calibration

  34. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

    Sep 1, 2026Kangjia Zhao, Jiajun Li, Haozhan Shen +8Tool-Use EvaluationLLM Agent Evaluation

  35. DualStake: Dual-Path Confidence Calibration in Deep Research Agents

    Sep 1, 2026Yinuo Xu, Yuwei Liang, Jianjie Cheng +4Deep Research AgentsLanguage Model Calibration

  36. Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

    Aug 31, 2026Qiyao Yan, Chenpeng Wang, Liangming PanLLM EvaluationLanguage Model Calibration

  37. Calibrating Small Language Models for Claim Check-Worthiness Detection

    Aug 31, 2026Pratuat Amatya, V Venktesh, Vinay SettyClaim VerificationSmall Language Models

  38. CoMPASS: Collaborative Molecular Property Prediction via Adaptive Small-Large Model Synergy

    Aug 31, 2026Wentao Li, Jiangjie Qiu, Yijun Li +2Graph Neural NetworksLanguage Model Calibration

  39. Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection

    Aug 18, 2026Bin Li, Dongdong Wang, Siyang LuPost-Hoc CalibrationOnline Anomaly Detection

  40. Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

    Aug 13, 2026Irina Proskurina, Mayank Kumar, Oyindolapo O. KomolafeConfidence Estimation in Language ModelsQuestion Answering

  41. ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

    Aug 11, 2026Md Rabiul Islam, Samir Abdaljalil, Erchin Serpedin +1Selective PredictionClinical Decision Support

  42. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration