Confidence Estimation in Language Models

Latest papers 134

All topics
CardsList
  1. Characterizing Overconfident Failure in LLM-Based Code Generation

    Oct 8, 2026Ravishka Rathnasuriya, Wei YangLLM Code GenerationConfidence Estimation in Language Models

  2. The Confidence Game: Strategic Miscalibration in Human-AI Delegation

    Oct 7, 2026Raghu Arghal, Saswati Sarkar, Shirin Saeedi BidokhtiLLM Agent ReliabilityConfidence Estimation in Language Models

  3. U-Space: Uncovering When and Why Uncertainty Arises in Language Models

    Oct 6, 2026Tobias Braun, Nils Loose, Alexander Herzog +4LLM Uncertainty EstimationConfidence Estimation in Language Models

  4. Confidence Reasoning Graphs: Structured Confidence Estimation for LLM Agents

    Oct 6, 2026Brendan King, Farima Fatahi Bayat, Jean-Flavien Bussotti +2Probability CalibrationConfidence Estimation in Language Models

  5. Cross-lingual Calibration of Pre-Generation Success Probes for Multilingual LLM Routing

    Oct 5, 2026Andrea Paganelli, Stefano Civelli, Pietro Bernardelle +1Confidence Estimation in Language ModelsLanguage Model Calibration

  6. Also Small Models Can Reasonably Self-Evaluate Their Confidence

    Sep 30, 2026Idil Kapikiran, Thomas Decker, Thomas RunklerConfidence Estimation in Language ModelsSmall Language Models

  7. Benchmarking System One decision models against trained classifiers and language models for automated decision gates

    Sep 29, 2026Amir Rafe, Subasish DasLLM Decision-MakingLLM Evaluation

  8. Probability is Not Enough: Exploring and Counting Divergent Tokens for Reasoning Uncertainty Quantification in LLMs

    Sep 29, 2026Feiyang Li, Shengjing Liu, Qi Zhan +7Uncertainty QuantificationConfidence Estimation in Language Models

  9. TRACE: Single-Pass Decoding-Trace Risk Localization for Generation Calibration

    Sep 28, 2026Yuebin Xu, Xuemei Peng, Junlan Chen +2Confidence Estimation in Language ModelsLanguage Model Calibration

  10. When Confidence Rises Too Early: Detecting Shortcut Reasoning via Premature Answer Commitment

    Sep 28, 2026Zhaohan Zhang, Junjie Liu, Chengzhengxu Li +6Faithfulness of Language Model ExplanationsConfidence Estimation in Language Models

  11. Semantic Uncertainty Quantification Needs Factual Equivalence

    Sep 28, 2026Joseph Hoche, Quentin Guimard, Gianni FranchiConfidence Estimation in Language ModelsFactual Consistency Evaluation

  12. Beyond Verbalized Confidence: Calibrating Reasoners with Differentiable Readouts

    Sep 28, 2026Chenxiao Fan, Chongming Gao, Gangyi Zhang +8Confidence Estimation in Language ModelsRL for Language Model Reasoning

  13. When Words Fall Short: Iterative Synergy Between Verbalized Reasoning and Hidden Features for LLM Confidence Estimation

    Sep 28, 2026Yekun Xu, Ante Wang, Jingyi Ren +3Confidence Estimation in Language ModelsLLM Reliability

  14. LLMs learn different forms of metacognition when trained to predict their own accuracy

    Sep 27, 2026Nicolas Yax, Stefano Palminteri, Pierre-Yves OudeyerConfidence Estimation in Language ModelsLanguage Model Calibration

  15. Shared Experience, Separate Learning: Companion Confidence Calibration for LLMs

    Sep 27, 2026Shiyu Ni, Keping Bi, Jiafeng Guo +4Confidence Estimation in Language ModelsLanguage Model Calibration

  16. Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models

    Sep 27, 2026Yadong Xi, Rongsheng Zhang, Tangjie Lv +2Confidence Estimation in Language ModelsLanguage Model Calibration

  17. Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs

    Sep 24, 2026Aaron Isidore Grace, Weiran WangAudio-Language Model EvaluationAudio QA

  18. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLLM EvaluationConfidence Estimation in Language Models

  19. Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models

    Sep 21, 2026Kevin David Hayes, Arka Pal, Haosong Zhang +2Language Model Error DetectionConfidence Estimation in Language Models

  20. Intrinsic Sequence-Likelihood Confidence in Retrieval-Dominated Extractive QA: Two Pre-Specified Negatives, and What They Do and Do Not Attribute

    Sep 17, 2026Gunwoo Lee, Changmin Sung, Sang-Hwan Gwak +3LLM EvaluationSelective Prediction

  21. The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models

    Sep 16, 2026Jisoo Yang, Jaeho Han, Trung X. Pham +1VLM EvaluationConfidence Estimation in Language Models

  22. Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

    Sep 15, 2026Caiqi Zhang, Xiaochen Zhu, Chengzu Li +3Confidence Estimation in Language ModelsLLM Uncertainty Estimation