Overconfidence

Momentum

5 papers in the last four weeks, up 67% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 47

All topics
CardsList
  1. When Confidence Rises Too Early: Detecting Shortcut Reasoning via Premature Answer Commitment

    Sep 28, 2026Zhaohan Zhang, Junjie Liu, Chengzhengxu Li +6Reasoning SkillsOverconfidence

  2. When World Models Lie: Adaptive Safety Analysis Under Wrong Imaginations

    Sep 28, 2026John Cao, Somil BansalSafety FiltersLatent World Models

  3. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLarge Language Model EvaluationOverconfidence

  4. Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

    Aug 13, 2026Irina Proskurina, Mayank Kumar, Oyindolapo O. KomolafeInstruction TuningInstruction-Tuned Models

  5. Revisiting Overestimation Bias Problem of Q-learning: Settling Large Discrete Action Space via Action Intersection

    Aug 13, 2026Pu Li, Tao Tan, Hong Xie +2Q-LearningAction Space

  6. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

    Aug 10, 2026Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam +1OverconfidenceUncertainty

  7. Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

    Aug 7, 2026Ruochen Jin, Zhanliang Wang, Zongyu Dai +2OverconfidenceLoss Function

  8. GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

    Aug 5, 2026Shuo Liu, Huixiang Cai, Weiru Zhang +1AdsGeogs-Slam

  9. Revisiting TD Target Aggregation under Uncertainty in Q-Learning

    Aug 4, 2026Lipeng Zu, Xiaonan ZhangDeep Q-NetworksQ-Learning

  10. Belief-Guided Decision Making with Uncertainty Gating in the Game of Go

    Jul 29, 2026Mehrad Yaghoubi, Azam Bastanfard, Abbas Jalilvand +1Monte Carlo Tree SearchChess

  11. Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

    Jul 29, 2026Gong Gao, Xiao Lai, Ziqi Xie +3Soft Actor-CriticPessimism

  12. Priors learned from legacy reconstructions inherit undetectable overconfidence

    Jul 23, 2026Ali Siahkoohi, Sina AlemohammadBayesian Inverse ProblemsConfidence Intervals

  13. When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

    Jul 8, 2026Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe +2Vision-Language Model AdaptationRecent Vision-Language Models

  14. ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

    Jun 24, 2026Siyi Liu, Aaron Halfaker, Dan Roth +1Evidence ConflictTruth

  15. One-Step Generalization Ratio Guided Optimization for Domain Generalization

    Jun 15, 2026Sumin Cho, Dongwon Kim, Kwangsu KimValue AlignmentOverconfidence

  16. Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier

    Jun 9, 2026Kaiwen Shi, Zheyuan Zhang, Han Bao +2UncertainUncertainty

  17. GUI-AC: Enhancing Continual Learning in GUI Agents

    Jun 9, 2026Can Lin, Tao Feng, Hangjie Yuan +3Graphical User Interface AgentsReinforcement Fine-Tuning

  18. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

    Jun 6, 2026Zongrng Li, Mingzheng Yang, Lei Zou +8Scholar Information DatabaseOverconfidence

  19. Calibrating Overconfidence Without Sacrificing Confidence: Probe-Conditioned Head Intervention for LLMs

    Jun 2, 2026Ke Li, Chongzhe Zhang, Zifan Zeng +3OverconfidenceInstruction-Tuned Models

  20. Large Language Models Are Overconfident in Their Own Responses

    Jun 2, 2026Mario Sanz-Guerrero, Manuel Mager, Katharina von der WenseInstruction-Tuned ModelsOverconfidence

  21. Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?

    May 28, 2026Yue Zhang, Zun Wang, Han Lin +3Spatial ReasoningVisual Evidence

  22. Conservative neural posterior estimation via distributionally robust training

    May 27, 2026William Laplante, Yuga Hikida, Charita Dellaporta +2Distributionally-Robust OptimizationOverconfidence

  23. Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

    May 27, 2026Max Lamparth, Daniel Fein, Andreas Haupt +2Progress Reward ModelingMitigation

  24. Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation?

    May 25, 2026Jun Li, Ziwei Qin3D Medical Image SegmentationSemantic Segmentation

  25. Understanding and Mitigating Premature Confidence for Better LLM Reasoning

    May 23, 2026Jingchu Gai, Guanning Zeng, Christina Baek +4LLM Reasoning StrategiesOverconfidence

  26. Regret Analysis of Retry-Based Bandits

    May 20, 2026Bingkui Tong, Junpei Komiyama, Soichiro Nishimori +1Stochastic Multi-Armed BanditsRegret

  27. Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

    May 19, 2026Grandee Lee, Yue Wang, Che Yee Lye +1Computerized Adaptive TestingRubrics

  28. Sign-Separated Asymmetric Finite-Time Error Analysis of Q-Learning

    May 15, 2026Donghwan LeeQ-LearningValue Functions

  29. Beyond ECE: Calibrated Size Ratio, Risk Assessment, and Confidence-Weighted Metrics

    May 3, 2026Fernando Martin-Maroto, Nabil Abderrahaman, Gonzalo G. de PolaviejaOverconfidenceConfidence Calibration

  30. Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

    Apr 24, 2026Prakul Sunil Hiremath, Harshit R. HiremathLLM Reasoning StrategiesOverconfidence

  31. From If-Statements to ML Pipelines: Revisiting Bias in Code-Generation

    Apr 23, 2026Minh Duc Bui, Xenia Heilmann, Mattia Cerrato +2Large Language Model BiasCode Generation

  32. You Don't Need Public Tests to Generate Correct Code

    Apr 23, 2026Kaushitha Silva, Srinath PereraTest GenerationCode Generation

  33. Revisiting Catastrophic Forgetting in Continual Knowledge Graph Embedding

    Apr 21, 2026Gerard Pons, Carlos Escolano, Besim Bilalli +1Knowledge Graph EmbeddingsCatastrophic Forgetting

  34. QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

    Apr 17, 2026Jeremy Qin, Maksym AndriushchenkoLarge Language Model ForecastingFrontier Models

  35. Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

    Apr 2, 2026Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil +1Medical Visual Question AnsweringConfidence Calibration

  36. DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

    Mar 16, 2026Yifan Yang, Lei Zou, Wenjing Gong +6Post-Disaster Damage AssessmentMultimodal Model

  37. Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

    Nov 24, 2025Xiangjie Sui, Songyang Li, Hanwei Zhu +3Overconfidence

  38. Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization

    May 29, 2025Chengli Tan, Yubo Zhou, Haishan Ye +7Sharpness-Aware MinimizationRecalibration

  39. Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity

    May 23, 2025Shiyu Ni, Keping Bi, Jiafeng Guo +1OverconfidenceLarge Language Models Fail

  40. Understanding and Mitigating Under-Confidence in GNNs from the Final Layer

    May 16, 2025Jincheng Huang, Jie Xu, Xiaoshuang Shi +3Graph Neural NetworksConfidence Estimation