Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Sequential statistical inference for Large Language Models: Representation, validity, and monitoring

    May 30, 2026Yao XieLanguage Model CalibrationLLM Reliability

  2. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelsLanguage Model Calibration

  3. BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

    May 29, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham +3Multilingual Language Model EvaluationLanguage Model Error Detection

  4. Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty

    May 29, 2026Kyle Moore, Jesse Roberts, Daryl Watson +2Confidence Estimation in Language ModelsLLM Interpretability

  5. Counterfactual Graph for Multi-Agent LLM Calibration

    May 28, 2026Jiatan Huang, Mingchen Li, Ziming Li +3AI Agent ReliabilityLanguage Model Calibration

  6. Conformal Certification of Reasoning Trace Prefixes

    May 28, 2026Matt Y. Cheung, Ashok Veeraraghavan, Hanjie Chen +1Conformal PredictionLanguage Model Calibration

  7. Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting

    May 26, 2026Hui Dai, Ryan Teehan, Parsa Torabian +1Post-Hoc CalibrationProbabilistic Forecasting

  8. Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

    May 26, 2026Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake +1Language Model CalibrationLLM Uncertainty Estimation

  9. Innovation: An Almost Characterization of Hallucination

    May 26, 2026Nishant P. Das, Piyush SrivastavaHallucination in Language ModelsLanguage Model Calibration

  10. Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

    May 25, 2026Federico Torrielli, Peter Schneider-Kamp, Lukas Galke PoechConfidence Estimation in Language ModelsLLM Interpretability

  11. Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

    May 25, 2026Alexander Apartsin, Omri Sason, Yehudit ApersteinLLM EvaluationLanguage Model-Based Control

  12. Uncertainty Decomposition via Cyclical SG-MCMC and Soft-label Learning for Subjective NLP

    May 23, 2026Keito Inoshita, Takato UenoSoft-Label LearningBayesian Neural Networks

  13. Self-Improving In-Context Learning

    May 22, 2026Baturay Saglam, Dionysis KalogeriasLanguage Model CalibrationIn-Context Learning

  14. Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

    May 20, 2026Zheyuan Zhang, Kaiwen Shi, Han Bao +3RL for Language Model ReasoningPolicy Optimization

  15. Reinforcement Learning over Predictive Distributions for LLM Regression

    May 20, 2026Jungsoo Park, Hyungjoo Chae, Ethan Mendes +4Distributional RLRL for Language Models

  16. BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation

    May 19, 2026Zijun Jia, Yuanchang Ye, Sen Jia +6Retrieval-Augmented GenerationSelective Prediction

  17. Retrieval-Augmented Linguistic Calibration

    May 19, 2026Yi-Fan Yeh, Linwei Tao, Minjing Dong +4Confidence Estimation in Language ModelsLanguage Model Calibration

  18. Diagnosing Korean-Language LLM Political Bias via Census-Grounded Agent Simulation

    May 18, 2026Sungwoo KangPolitical Bias in Language ModelsLanguage Model Calibration

  19. ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

    May 17, 2026Tianxiang Xu, Xiaoyan Zhu, Xin Lai +1Reward ModelingReinforcement Learning

  20. Improving Cross-Cultural Survey Simulation with Calibrated Value Personas

    May 15, 2026Axel Abels, Elias Fernandez Domingos, Apurva Shah +1Language Model CalibrationCultural Bias in Language Models

  21. Calibrating LLMs with Semantic-level Reward

    May 15, 2026Fengfei Yu, Ruijia Niu, Dongxia Wu +2Language Model CalibrationLLM Reliability