Confidence Calibration

Momentum

20 papers in the last four weeks, up 186% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 100

All topics
CardsList
  1. Probability is Not Enough: Exploring and Counting Divergent Tokens for Reasoning Uncertainty Quantification in LLMs

    Sep 29, 2026Feiyang Li, Shengjing Liu, Qi Zhan +7Large Language Model UncertaintyConfidence Calibration

  2. Jev thinks "I don't know'', but doesn't say it: Introducing Sys1Cal-v1 Dataset for Probability Calibration

    Sep 28, 2026Riccardo PorceddaProbabilityConfidence Calibration

  3. On the Limits of Metacognitive Monitoring in LLMs

    Sep 28, 2026Dongqi Han, Yifan Yang, Dongsheng LiMetacognitionConfidence Calibration

  4. Do System One Decisions Add Up? A Study of Probabilistic Coherence

    Sep 27, 2026Saman Sarker JoyConfidence CalibrationDecisions

  5. Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models

    Sep 27, 2026Yadong Xi, Rongsheng Zhang, Tangjie Lv +2Confidence CalibrationLarge Reasoning Models

  6. Return or Revise? Learning When Revision Helps Retrieval-Augmented QA

    Sep 24, 2026Nicholas Kashani Motlagh, Tim Anderson, Jeremy Gwinnup +1Confidence Calibration

  7. Domain Recentering and Confidence-Weighted Prior Calibration for Vision-Language Models

    Sep 24, 2026Youngeun Seol, Jimin Shin, Heeseo Yoon +1Visual EmbeddingsLogit Lens

  8. Predicting Emerging Topics from Outliers: A Prospective Study of Weak Signals in Embedding Space

    Sep 24, 2026Evangelia Zve, Gauvain Bourgne, Jean-Gabriel GanasciaTopic ModelingOutliers

  9. SupportCal: Label-Free Calibration of Post-Trained LLMs via Reference Support and Corroboration

    Sep 21, 2026Linhan Luo, Lequan Lin, Dai Shi +3Post-TrainingConfidence Calibration

  10. Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

    Sep 15, 2026Caiqi Zhang, Xiaochen Zhu, Chengzu Li +3Confidence EstimationConfidence Calibration

  11. R2VC: Modular Fact-Checking with Retrieval, Verification, and Confidence Calibration

    Sep 14, 2026Dhruv Dixit, Paritosh PandeyFact-CheckingConfidence Calibration

  12. Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning

    Sep 12, 2026Bincheng Gu, Min Gao, Zongwei Wang +3Stable Test-Time AdaptationTest-Time Adaptation

  13. Legible Failures: Detecting and Repairing In-Context Binding Errors

    Sep 11, 2026Manas Venkata Sai Ravulapalli, Samrath Singh Chadha, Abhinav M. HariIn-ContextConfidence Calibration

  14. Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations

    Sep 10, 2026Priyanka Mary Mammen, Emil Joswin, Srujananjali MedicherlaProduction Agentic SystemsConfidence Calibration

  15. ProbPlug: A Plugin Uncertainty Network for Reliable Confidence in LLM Binary Classification

    Sep 9, 2026Jianzong Wang, Chuhang Liu, Botao Zhao +6Confidence EstimationConfidence Calibration

  16. DualStake: Dual-Path Confidence Calibration in Deep Research Agents

    Sep 1, 2026Yinuo Xu, Yuwei Liang, Jianjie Cheng +4Confidence CalibrationDeep Research

  17. Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered

    Aug 29, 2026Aryo Pradipta Gema, Neel Rajani, Rohit Saxena +2Explanation FaithfulnessLarge Reasoning Models

  18. Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

    Aug 13, 2026Irina Proskurina, Mayank Kumar, Oyindolapo O. KomolafeInstruction TuningInstruction-Tuned Models

  19. Confidence Calibration of Deep Learning Systems

    Aug 12, 2026Coby PensoCalibrated UncertaintyOnline Conformal Prediction

  20. LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

    Aug 12, 2026Beomsik Cho, Jinhyeong Kim, Dongseok Lee +1Citation HallucinationResponses

  21. Attention-Path Fragility as an Uncertainty Signal in Large Language Models

    Aug 11, 2026Minsoo Kim, Sungyoung Ji, Kisung Moon +1Large Language Model UncertaintySemantic Entropy

  22. Semi-Dense Matching Uncertainty Is Not Just Local Confidence

    Aug 9, 2026Khoa Hoang, Hoang-Tuan Nguyen, Huong Ninh +2Coarse-To-FineConfidence Calibration

  23. Vision-Language Model Confidence Is Not a Property of the Answer

    Aug 6, 2026Reza Khanmohammadi, Erfan Miahi, Ivan Brugere +4Confidence CalibrationVision-Language Foundation Models

  24. Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

    Aug 6, 2026Jiaming Wei, Zekun Wu, Adriano Koshiyama +1Web AgentsStrategic Agents

  25. Confidence matters: Leveraging Multi-view Geometric Priors for GS-based Reconstruction

    Aug 6, 2026Hongyu Zhou, Zorah LähnerGeometric Priors3D Gaussian

  26. Sliding Sensors: Configurable Confidence in State Estimation for Continuum Robots

    Aug 5, 2026Ella Walsh, Spencer Teetaert, Eric Diller +2State EstimationSoft Robotics

  27. metasignal: A Python Package for Comprehensive Metacognitive Analysis and Decision-Making

    Jul 31, 2026Saurabh Ranjan, Mukesh Makwana, Konstantina Sokratous +1MetacognitionMeta

  28. One Human, NN Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

    Jul 30, 2026Cesare Zavattari, Alessandro Tommasi, Giuseppe PrencipeModel AuditingConfidence Calibration

  29. CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation

    Jul 29, 2026Yushan Liu, Peibo Sun, Xintao Chao +8Action ChunksLong-Horizon Manipulation

  30. Position: Evaluation Scores Are Perishable Knowledge Claims

    Jul 28, 2026Sankalp Gilda, Shlok GildaConfidence CalibrationPosition

  31. Efficient Sequential Evaluation of Large Language Models

    Jul 19, 2026Chia-Yu Hsu, Shubhanshu ShekharLarge Language Model EvaluationConfidence Calibration

  32. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

    Jul 14, 2026Yaopei Zeng, Congchao Wang, JianHang Chen +3Large Language Model AgentsConfidence Estimation

  33. Revisiting Matching Response and Swept Feature Volumes for Wide-baseline Omnidirectional Stereo

    Jul 13, 2026Seungjin Jeon, Jongwoo Lim, Changhee WonStereo VisionGeometric Regularization

  34. Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

    Jul 10, 2026Nirjhar Das, Md. Al-Mamun ProvathMultimodal QueryReasoning Skills

  35. Future Confidence Distillation in Large Language Models

    Jul 8, 2026Sahil KaleConfidence EstimationConfidence Calibration

  36. On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

    Jul 5, 2026Chee Heng Tan, Zhuoyi Lin, Mehul Motani +1Large Language Model Reinforcement LearningLarge Language Model Reliability

  37. Fixed-Confidence Best-Arm Identification for Causal Mediation Analysis

    Jul 5, 2026Harsh Shrivastava, Yuta Kawakami, Junpei Komiyama +1Causal Mediation AnalysisConfidence Calibration

  38. Confidence-feedback-weighted graph matching network: online-offline laser-induced damage site matching under complex interference

    Jun 28, 2026Yueyue Han, Guanhua Chen, Hangcheng Dong +6Harder Better Faster Denser Feature MatchingQuery Image

  39. Confidence Sequences for Online Statistical Model Checking of Markov Decision Processes

    Jun 24, 2026Konstantin Kueffner, Tobias Meggendorfer, Maximilian Weininger +1Markov Decision ProcessesProbabilistic Model Checking

  40. Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration

    Jun 23, 2026Pietro Tropeano, Maria Maistro, Tuukka Ruotsalo +1InterpretabilityExplanation Faithfulness

  41. Latent Confidence Alignment for LLM Self-Assessment

    Jun 20, 2026Ting-Yu Chen, Tingting Yu, Pei-Cing Huang +3Self-EvaluationConfidence Calibration

  42. Quantile Adaptive Temperature Scaling for Confidence Calibration

    Jun 19, 2026Omprakash Chakraborty, Leo Fillioux, Ismail Ben Ayed +1Confidence EstimationConfidence Calibration

  43. Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

    Jun 18, 2026Yuetian Du, Yucheng Wang, Ming Kong +4Confidence EstimationMedical Visual Question Answering

  44. Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction

    Jun 17, 2026Zhuangzhuang Pan, Ning Dong, Yingna Su +1Emotion RecognitionCross-Modal Conflicts

  45. Target-confidence Recourse Using tSeTlin machines: TRUST

    Jun 17, 2026K. Darshana Abeyrathna, Sara El Mekkaoui, Nils Enric Canut Taugbøl +1Counterfactual GenerationConfidence Calibration

  46. Confidence Composition for Multiagent Language Model Systems

    Jun 11, 2026Ali Elahi, Michael J. Curry, Barbara Di EugenioMulti-Agent DebateConfidence Estimation