Language Model Calibration

Latest papers 247

All topics
CardsList
  1. Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use

    May 14, 2026Renning Pang, Tian Lan, Leyuan Liu +3Language Model CalibrationLLM Tool Use

  2. Inducing Artificial Uncertainty in Language Models

    May 13, 2026Sophia Hager, Simon Zeng, Nicholas AndrewsConfidence Estimation in Language ModelsLanguage Model Calibration

  3. Discovery of Hidden Miscalibration Regimes

    May 13, 2026Katarzyna Kobalczyk, Mihaela van der SchaarPost-Hoc CalibrationLanguage Model Calibration

  4. Training Large Language Models to Predict Clinical Events

    May 12, 2026Benjamin Turtel, Paul Wilczewski, Kris SkotheimHealthcareLanguage Model Calibration

  5. ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

    May 12, 2026Chen Li, Xiaoling Hu, Songzhu Zheng +2Confidence Estimation in Language ModelsLanguage Model Calibration

  6. Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement

    May 12, 2026Jinyuan Wang, Ningyuan Deng, Yi YangLanguage Model CalibrationLLM Reliability

  7. Probabilistic Calibration Is a Trainable Capability in Language Models

    May 12, 2026Davide Baldelli, Sruthi Kuriakose, Maryam Hashemzadeh +2LLM Fine-TuningControllable Text Generation

  8. ROMER: Expert Replacement and Router Calibration for Robust MoE LLMs on Analog Compute-in-Memory Systems

    May 12, 2026Wenyong Zhou, Yuannuo Feng, Yizhe Chen +6Compute-in-MemoryMixture-of-Experts Language Models

  9. Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

    May 11, 2026Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya +6LLM EvaluationLanguage Model Decoding

  10. Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

    May 11, 2026Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen +5LLM AlignmentCultural Alignment

  11. ConQuR: Corner Aligned Activation Quantization via Optimized Rotations for LLMs

    May 11, 2026Chayne Thrash, Ali Abbasi, Soheil KolouriRotation-Based QuantizationLLM Inference Acceleration

  12. Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

    May 11, 2026Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada +7LLM AuditingMultimodal Large Language Models

  13. Task-Aware Calibration: Provably Optimal Decoding in LLMs

    May 11, 2026Tim Tomov, Dominik Fuchsgruber, Rajeev Verma +1Language Model DecodingMBR Decoding

  14. Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges

    May 10, 2026Yanran LiLLM EvaluationLLM-as-a-Judge

  15. NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

    May 8, 2026Jian Lan, Zhicheng Liu, Xinpeng Wang +5VLM EvaluationPhysical Reasoning

  16. A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

    May 8, 2026Zhanliang Wang, Jiancong Xiao, Ruochen Jin +3LLM EvaluationConfidence Estimation in Language Models

  17. Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

    May 8, 2026Sree Bhattacharyya, Samarth Khanna, Leona Chen +3LLM EvaluationConfidence Estimation in Language Models

  18. Bayesian Fine-tuning in Projected Subspaces

    May 8, 2026Viktar Dubovik, Patryk Marszałek, Jacek Tabor +1Bayesian Neural NetworksFine-Tuning

  19. Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

    May 8, 2026Kejia Chen, Jiawen Zhang, Yihong Wu +5LLM AlignmentDirect Preference Optimization

  20. Log-Likelihood, Simpson's Paradox, and the Detection of Machine-Generated Text

    May 7, 2026Tom Kempton, Viktor Drobnyi, Maeve Madigan +1AI-Generated Text DetectionLanguage Model Calibration

  21. Saliency-Aware Regularized Quantization Calibration for Large Language Models

    May 7, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationLanguage Model Calibration

  22. Distilling Bayesian Belief States into Language Models for Auditable Negotiation

    May 6, 2026Zongqi Cui, Baihan LinMulti-Agent NegotiationOpponent Modeling

  23. EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage

    May 5, 2026Richard J. Young, Alice M. MatthewsGender Bias in Language ModelsClinical Triage