Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

    Aug 7, 2026Ruochen Jin, Zhanliang Wang, Zongyu Dai +2LLM Fine-TuningLanguage Model Calibration

  2. Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

    Aug 6, 2026Yuma Asato, Kiyoaki Shirai, Natthawut KertkeidkachornLLM EvaluationLLM-as-a-Judge

  3. Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

    Aug 5, 2026Elena Merdjanovska, Omar Zaidan, Andreas RückléLLM EvaluationSelective Prediction

  4. Quantization Effects on Biomedical LLM Reliability

    Aug 4, 2026Anton Rasmussen, Hong QinLLM QuantizationText Classification

  5. Conformalized Large Language Models under Configuration Shift

    Aug 2, 2026Yuqicheng Zhu, Jialin Yu, Lin Li +7Conformal PredictionLanguage Model Calibration

  6. Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

    Jul 31, 2026Xujun Che, Yuchen Yuan, Weida Zhao +1Reinforcement LearningKL-Regularized RL

  7. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    Jul 31, 2026Xinyan Guan, Jiali Zeng, Chunlei Xin +5Overthinking in Language ModelsRL for Language Model Reasoning

  8. Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

    Jul 29, 2026Parishruthi Ganesh, Gerry Dozier, Cheryl SealsLLM EvaluationZero-Shot Text Classification

  9. Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models

    Jul 27, 2026Murilo Salem, Luísa Böhm, Daniel Pontes +1Selective PredictionGroup-Conditional Conformal Prediction

  10. A Self-Calibrating Agentic AI Framework for Autonomous Edge Resource Allocation

    Jul 24, 2026Fin Gentzen, Marla Grunewald, Iulisloi Zacarias +2Edge ComputingLanguage Model Calibration

  11. Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

    Jul 20, 2026Matthew F. DixonUncertainty QuantificationConfidence Estimation in Language Models

  12. Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration

    Jul 15, 2026Shuhao Li, Guodong Du, Anhao Zhao +3Confidence Estimation in Language ModelsLanguage Model Calibration

  13. Temperature Scaling Is Not Enough: Calibration Gaps Under Human Label Distributions

    Jul 15, 2026Wisdom DogahPost-Hoc CalibrationLanguage Model Calibration

  14. LLM Judges Can Be Too Generous When There Is No Reference Answer

    Jul 14, 2026Chalamalasetti Kranti, Sowmya VajjalaLLM EvaluationLLM-as-a-Judge

  15. CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

    Jul 13, 2026Qiyang Sun, Yi Chang, Yupei Li +3Language Model CalibrationMultimodal Sentiment Analysis

  16. Reliability Scaling Laws for Quantized Large Language Models

    Jul 12, 2026Sirine Ayadi, Sándor Daróczi, Stephan Günnemann +1LLM QuantizationLanguage Model Calibration

  17. Validity of LLMs as data annotators: AMALIA on authority

    Jul 9, 2026Manuel PitaMultilingual Language Model EvaluationMoral Reasoning in Language Models

  18. Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

    Jul 9, 2026Ethan Leung, Elias Lumer, Corey Feld +3LLM-as-a-JudgeCitation Verification

  19. Eigenvalue Calibration for Semantic Embeddings of Large Language Models

    Jul 9, 2026Sebastian G. Gruber, Nassim Walha, Francis Bach +1Confidence Estimation in Language ModelsLanguage Model Calibration