LLM Uncertainty Estimation

LLM: Large Language Model

Latest papers 298

All topics
CardsList
  1. Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

    Jun 15, 2026Ali Marashian, Alexis Palmer, Katharina von der WenseConfidence Estimation in Language ModelsLanguage Model Calibration

  2. CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

    Jun 12, 2026Juming Xiong, Weixin Liu, Kevin Guo +9CoT ReasoningRL for Language Model Reasoning

  3. Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

    Jun 11, 2026Nathaniel Bottman, Yinhong Liu, Kyle RichardsonCompositional ReasoningReasoning Consistency in Language Models

  4. LLMs Can Better Capture Human Judgments--With the Right Prompts

    Jun 10, 2026Danica Dillion, Chen Cecilia Liu, Baihui Wang +5Human Preference EvaluationLLM Alignment

  5. Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

    Jun 9, 2026Ali Keramati, Justin Cheok, Jacob Horne +1LLM Agent EvaluationMulti-Agent Debate

  6. The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

    Jun 9, 2026Ali Keramati, Justin Cheok, Jacob Horne +1LLM Agent EvaluationMulti-Agent Debate

  7. FASE: Fast Adaptive Semantic Entropy for Code Quality

    Jun 8, 2026Shizhe Lin, Ladan TahvildariSemantic EntropyLLM Uncertainty Estimation

  8. Code Is More Than Text: Uncertainty Estimation for Code Generation

    Jun 8, 2026Yuling Shi, Caiqi Zhang, Yuexian Li +4Confidence Estimation in Language ModelsLLM Reliability

  9. Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

    Jun 7, 2026Ting Wang, Yuanjie Shi, Yan Yan +1LLM InferenceLLM Reasoning with Graphs

  10. Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

    Jun 5, 2026Yijin Zhou, Linqian Zeng, Xiaoya Lu +4Reinforcement LearningLLM Uncertainty Estimation

  11. How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

    Jun 4, 2026Tanvi Thoria, Kiana Jafari, Marc R. Schlichting +1Language Model Error DetectionLLM Reliability

  12. CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction

    Jun 4, 2026Mohammad Anas Jawad, Cornelia CarageaConfidence Estimation in Language ModelsLanguage Model Calibration

  13. Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

    Jun 2, 2026Johanne Medina, Tianyi Zhou, Keivin Isufaj +2Uncertainty QuantificationConfidence Estimation in Language Models

  14. Large Language Models Are Overconfident in Their Own Responses

    Jun 2, 2026Mario Sanz-Guerrero, Manuel Mager, Katharina von der WenseConfidence Estimation in Language ModelsLLM Prompting

  15. Uncertainty-Aware Clarification in LLM Agents with Information Gain

    Jun 2, 2026Mengyi Deng, Zhiwei Li, Xin Li +4Clarification Question GenerationTool-Using Agents

  16. The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

    Jun 1, 2026Mirko Lai, Alessandra Urbinati, Simona Frenda +2Annotator DisagreementConformal Prediction

  17. On the Salience of Low-Probability Tokens for AI-Generated Text Detection: A Multiscale Uncertainty Perspective

    Jun 1, 2026Yikai Guo, Bin Wang, Xilai Fan +2AI-Generated Text DetectionLLM Uncertainty Estimation

  18. The Role of Ambiguity in Error Prediction via Uncertainty Quantification

    Jun 1, 2026Ieva Raminta Staliūnaitė, James Bishop, Andreas VlachosUncertainty QuantificationLLM Uncertainty Estimation

  19. Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

    Jun 1, 2026Yujia Tong, Yuxi Wang, Yunyang Wan +3LLM QuantizationLLM Evaluation

  20. TriLens: Per-Layer Logit-Lens Entropy for White-Box Hallucination Detection

    May 31, 2026Bohan Yang, Yijun Gong, Zhi Zhang +3Language Model Error DetectionLLM Reliability

  21. HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering

    May 31, 2026Md Motaleb Hossen Manik, Ge WangBiomedical QALLM Uncertainty Estimation

  22. Sequential statistical inference for Large Language Models: Representation, validity, and monitoring

    May 30, 2026Yao XieLanguage Model CalibrationLLM Reliability