Confidence Estimation in Language Models

Latest papers 134

All topics
CardsList
  1. Reading Calibrated Uncertainty from Language Model Trajectories

    May 19, 2026Aliai Eusebi, Alexander Herzog, Xiaoyu Liang +3Confidence Estimation in Language ModelsLLM Reliability

  2. Retrieval-Augmented Linguistic Calibration

    May 19, 2026Yi-Fan Yeh, Linwei Tao, Minjing Dong +4Confidence Estimation in Language ModelsLanguage Model Calibration

  3. Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

    May 19, 2026Xiaoou Liu, Tiejin Chen, Dengjia Zhang +3Uncertainty QuantificationConfidence Estimation in Language Models

  4. Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

    May 19, 2026Tiejin Chen, Longchao Da, Xiaoou Liu +1LLM EvaluationUncertainty Quantification

  5. Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning

    May 16, 2026Shuo Liu, Ding Liu, Shi-Ju RanConfidence Estimation in Language ModelsLLM Reliability

  6. Margin-Adaptive Confidence Ranking for Reliable LLM Judgement

    May 14, 2026Gaojie Jin, Yong Tao, Lijia Yu +1LLM EvaluationLLM-as-a-Judge

  7. Inducing Artificial Uncertainty in Language Models

    May 13, 2026Sophia Hager, Simon Zeng, Nicholas AndrewsConfidence Estimation in Language ModelsLanguage Model Calibration

  8. LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

    May 13, 2026Stef van BuurenLLM EvaluationConfidence Estimation in Language Models

  9. ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

    May 12, 2026Chen Li, Xiaoling Hu, Songzhu Zheng +2Confidence Estimation in Language ModelsLanguage Model Calibration

  10. Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs

    May 12, 2026Ali Asad, Stephen Obadinma, Anshul Pattoo +2Language Model Safety EvaluationConfidence Estimation in Language Models

  11. Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

    May 11, 2026Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur +4VLM EvaluationVision-Language Models

  12. A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

    May 8, 2026Zhanliang Wang, Jiancong Xiao, Ruochen Jin +3LLM EvaluationConfidence Estimation in Language Models

  13. Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

    May 8, 2026Sree Bhattacharyya, Samarth Khanna, Leona Chen +3LLM EvaluationConfidence Estimation in Language Models

  14. Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization

    May 7, 2026Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens +4Confidence Estimation in Language ModelsCoT Reasoning

  15. HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

    May 7, 2026Chengda Lu, Xiaoyu Fan, Wei XuConfidence Estimation in Language ModelsLLM Interpretability

  16. Geometry-Calibrated Conformal Abstention for Language Models

    Apr 30, 2026Rui Xu, Yi Chen, Sihong Xie +1Uncertainty QuantificationSelective Prediction

  17. How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

    Apr 24, 2026Dharshan Kumaran, Viorica Patraucean, Simon Osindero +2LLM Self-CorrectionLanguage Model Error Detection

  18. Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

    Apr 24, 2026Prakul Sunil Hiremath, Harshit R. HiremathConfidence Estimation in Language ModelsCoT Reasoning

  19. Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

    Apr 19, 2026Jingyi Ren, Ante Wang, Yunghwei Lai +5LLM EvaluationSelective Prediction

  20. Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

    Apr 19, 2026Yunkai Dang, Yifan Jiang, Yizhu Jiang +3Selective PredictionConfidence Estimation in Language Models

  21. Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification

    Apr 18, 2026Kimia Hamidieh, Veronika Thost, Walter Gerych +2Selective PredictionConfidence Estimation in Language Models

  22. Beyond Surface Statistics: Robust Conformal Prediction for LLMs via Internal Representations

    Apr 17, 2026Yanli Wang, Peng Kuang, Xiaoyu Han +2Confidence Estimation in Language ModelsConformal Prediction