LLM Uncertainty Estimation

LLM: Large Language Model

Latest papers 298

All topics
CardsList
  1. Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

    May 20, 2026Zheyuan Zhang, Kaiwen Shi, Han Bao +3RL for Language Model ReasoningPolicy Optimization

  2. Probabilistic Attribution For Large Language Models

    May 20, 2026Shilpika Shilpika, Carlo Graziani, Bethany Lusch +2LLM InterpretabilityLLM Uncertainty Estimation

  3. Reading Calibrated Uncertainty from Language Model Trajectories

    May 19, 2026Aliai Eusebi, Alexander Herzog, Xiaoyu Liang +3Confidence Estimation in Language ModelsLLM Reliability

  4. Retrieval-Augmented Linguistic Calibration

    May 19, 2026Yi-Fan Yeh, Linwei Tao, Minjing Dong +4Confidence Estimation in Language ModelsLanguage Model Calibration

  5. Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

    May 19, 2026Xiaoou Liu, Tiejin Chen, Dengjia Zhang +3Uncertainty QuantificationConfidence Estimation in Language Models

  6. Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

    May 19, 2026Tiejin Chen, Longchao Da, Xiaoou Liu +1LLM EvaluationUncertainty Quantification

  7. Descriptive versus Regulatory Uncertainty in Bounded Predictive Systems

    May 17, 2026Ahmed Gamal EldinLLM Uncertainty EstimationEpistemic Uncertainty

  8. Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning

    May 16, 2026Shuo Liu, Ding Liu, Shi-Ju RanConfidence Estimation in Language ModelsLLM Reliability

  9. Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning

    May 15, 2026Shireen Kudukkil Manchingal, Abhey Kalia, Fernanda Gonçalves +1LLM Answer VerificationEnergy-Based Models

  10. Calibrating LLMs with Semantic-level Reward

    May 15, 2026Fengfei Yu, Ruijia Niu, Dongxia Wu +2Language Model CalibrationLLM Reliability

  11. Margin-Adaptive Confidence Ranking for Reliable LLM Judgement

    May 14, 2026Gaojie Jin, Yong Tao, Lijia Yu +1LLM EvaluationLLM-as-a-Judge

  12. Uncertainty Quantification for Large Language Diffusion Models

    May 14, 2026Artem Vazhentsev, Vladislav Smirnov, David Li +3Uncertainty QuantificationLLM Hallucination Detection

  13. When Evidence Conflicts: Uncertainty and Order Effects in Retrieval-Augmented Biomedical Question Answering

    May 13, 2026Yikun Han, Mengfei Lan, Halil KilicogluSelective PredictionHealthcare

  14. Inducing Artificial Uncertainty in Language Models

    May 13, 2026Sophia Hager, Simon Zeng, Nicholas AndrewsConfidence Estimation in Language ModelsLanguage Model Calibration

  15. LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

    May 13, 2026Stef van BuurenLLM EvaluationConfidence Estimation in Language Models

  16. ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

    May 12, 2026Chen Li, Xiaoling Hu, Songzhu Zheng +2Confidence Estimation in Language ModelsLanguage Model Calibration

  17. Uncertainty Quantification for LLM-based Code Generation

    May 12, 2026Senrong Xu, Yuhao Tan, Yanke Zhou +6Uncertainty QuantificationLLM Uncertainty Estimation

  18. Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement

    May 12, 2026Jinyuan Wang, Ningyuan Deng, Yi YangLanguage Model CalibrationLLM Reliability

  19. Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty

    May 12, 2026Joykirat Singh, Zaid Khan, Archiki Prasad +5Partially Observable RLBayesian Inference

  20. AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment

    May 12, 2026Robin Linzmayer, Georgianna Lin, Di Coneybeare +22HealthcareClinical Triage

  21. Epistemic Uncertainty for Test-Time Discovery

    May 11, 2026Kainat Riaz, Muhammad Ahmed Mohsin, Ahsan Bilal +5RL for Language ModelsRL Exploration

  22. Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis

    May 11, 2026Junyu Lu, Deyi Ji, Xuanyi Liu +5Annotator DisagreementLLM Alignment

  23. ANCHOR: Abductive Network Construction with Hierarchical Orchestration for Reliable Probability Inference in Large Language Models

    May 11, 2026Wentao Qiu, Guanran Luo, Zhongquan Jian +3Abductive ReasoningBayesian Networks

  24. Trust or Abstain? A Self-Aware RAG Approach

    May 11, 2026Xi Zhu, Ziqi Wang, Kai Mei +5Retrieval-Augmented GenerationKnowledge Conflicts in Language Models

  25. A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

    May 8, 2026Zhanliang Wang, Jiancong Xiao, Ruochen Jin +3LLM EvaluationConfidence Estimation in Language Models