Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents

    Jun 1, 2026Aitor Arronte Alvarez, Naiyi Xie FinchamIntelligent Tutoring SystemsSocial Bias in Language Models

  2. Low-Resource Safety Failures Are Action Failures, Not Representation Failures

    May 31, 2026Rashad Aziz, Ikhlasul Akmal Hanif, Fajri KotoLanguage Model CalibrationLLM Safety

  3. A Finite-Calibration Regime Map for LLM Judge Panels

    May 31, 2026Bin Zhu, Yanghui RaoLLM-as-a-JudgeLanguage Model Calibration

  4. Sequential statistical inference for Large Language Models: Representation, validity, and monitoring

    May 30, 2026Yao XieLanguage Model CalibrationLLM Reliability

  5. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelsLanguage Model Calibration

  6. BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

    May 29, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham +3Multilingual Language Model EvaluationLanguage Model Error Detection

  7. Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty

    May 29, 2026Kyle Moore, Jesse Roberts, Daryl Watson +2Confidence Estimation in Language ModelsLLM Interpretability

  8. Counterfactual Graph for Multi-Agent LLM Calibration

    May 28, 2026Jiatan Huang, Mingchen Li, Ziming Li +3AI Agent ReliabilityLanguage Model Calibration

  9. Conformal Certification of Reasoning Trace Prefixes

    May 28, 2026Matt Y. Cheung, Ashok Veeraraghavan, Hanjie Chen +1Conformal PredictionLanguage Model Calibration

  10. Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting

    May 26, 2026Hui Dai, Ryan Teehan, Parsa Torabian +1Post-Hoc CalibrationProbabilistic Forecasting

  11. Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

    May 26, 2026Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake +1Language Model CalibrationLLM Uncertainty Estimation

  12. Innovation: An Almost Characterization of Hallucination

    May 26, 2026Nishant P. Das, Piyush SrivastavaHallucination in Language ModelsLanguage Model Calibration

  13. Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

    May 25, 2026Federico Torrielli, Peter Schneider-Kamp, Lukas Galke PoechConfidence Estimation in Language ModelsLLM Interpretability

  14. Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

    May 25, 2026Alexander Apartsin, Omri Sason, Yehudit ApersteinLLM EvaluationLanguage Model-Based Control

  15. Uncertainty Decomposition via Cyclical SG-MCMC and Soft-label Learning for Subjective NLP

    May 23, 2026Keito Inoshita, Takato UenoSoft-Label LearningBayesian Neural Networks

  16. Self-Improving In-Context Learning

    May 22, 2026Baturay Saglam, Dionysis KalogeriasLanguage Model CalibrationIn-Context Learning

  17. Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

    May 20, 2026Zheyuan Zhang, Kaiwen Shi, Han Bao +3RL for Language Model ReasoningPolicy Optimization

  18. Reinforcement Learning over Predictive Distributions for LLM Regression

    May 20, 2026Jungsoo Park, Hyungjoo Chae, Ethan Mendes +4Distributional RLRL for Language Models

  19. BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation

    May 19, 2026Zijun Jia, Yuanchang Ye, Sen Jia +6Retrieval-Augmented GenerationSelective Prediction

  20. Retrieval-Augmented Linguistic Calibration

    May 19, 2026Yi-Fan Yeh, Linwei Tao, Minjing Dong +4Confidence Estimation in Language ModelsLanguage Model Calibration

  21. Diagnosing Korean-Language LLM Political Bias via Census-Grounded Agent Simulation

    May 18, 2026Sungwoo KangPolitical Bias in Language ModelsLanguage Model Calibration