Language Model Calibration

Latest papers 247

All topics
CardsList
  1. On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

    Jul 5, 2026Chee Heng Tan, Zhuoyi Lin, Mehul Motani +1Reward HackingConfidence Estimation in Language Models

  2. Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

    Jul 4, 2026Diego Cerda-Mardini, Sarath Chandar, Sreenath MadathilLLM EvaluationProbability Calibration

  3. Will Scaling Improve Social Simulation with LLMs?

    Jul 2, 2026Caleb Ziems, William Held, Su Doga Karaca +3Opinion DynamicsLanguage Model Scaling Laws

  4. Bayesian Sparse Low-Rank Adaptation for Large Language Model Uncertainty Estimation

    Jul 2, 2026Jijie Zhang, Zhe Ren, Quan Zhang +1Low-Rank AdaptationLanguage Model Calibration

  5. Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    Jul 2, 2026Xuqing Yang, Yi Yuan, Shanzhe Lei +1LLM Inference EfficiencyRL for Language Models

  6. Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

    Jul 1, 2026Fei Wang, Chao Xue, Taoran Liu +3Mixed-Precision QuantizationLLM Quantization

  7. Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

    Jun 30, 2026Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona +2RL for Language ModelsReinforcement Learning

  8. Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

    Jun 30, 2026Zewen LiuLLM-as-a-JudgePairwise Preference Evaluation

  9. The Calibration Turn in AI-Assisted Research: A Conceptual and Methodological Framework for Evidence-Licensed Claims

    Jun 30, 2026Hongmin LiAI-Assisted Scientific ResearchLanguage Model Calibration

  10. An Empirical Study of Security Calibration in Large Language Models for Code

    Jun 30, 2026Mohammed Latif Siddiq, Md. Nafiu Rahman, Joanna C. S. SantosLLM SecurityLanguage Model Calibration

  11. When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

    Jun 29, 2026Zhichao Yang, Caiqi Zhang, Ruihan Yang +3LLM EvaluationConfidence Estimation in Language Models

  12. Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation

    Jun 29, 2026Zhe Dong, Fang Qin, Manish Shah +1Retrieval-Augmented GenerationSelective Prediction

  13. KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

    Jun 29, 2026Tao Feng, Xinke Jiang, Chao WuLanguage Model CalibrationAgentic RAG

  14. BaRA: Bayesian Adaptive Rank Allocation for Parameter-Efficient Fine-Tuning

    Jun 28, 2026Zhibin Duan, Yuhong Wang, Jiahong Fu +3Bayesian Neural NetworksLow-Rank Adaptation

  15. The strength of clinical evidence is recoverable from language model representations but not from their stated grades

    Jun 27, 2026Soroosh Tayebi ArastehLLM InterpretabilityLanguage Model Calibration

  16. Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

    Jun 27, 2026Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi +2LLM AlignmentLLM Fine-Tuning

  17. Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

    Jun 25, 2026Eren Senoglu, Federico Toschi, Nicolo Brunello +2Medical VQALanguage Model Calibration

  18. ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

    Jun 23, 2026Jisu Jeon, Seungyeon Jwa, Joosung Lee +6Audio-Language Model EvaluationPairwise Comparison

  19. Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration

    Jun 23, 2026Pietro Tropeano, Maria Maistro, Tuukka Ruotsalo +1LLM PruningLLM Interpretability

  20. Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

    Jun 20, 2026Colin Samplawski, Ramneet Kaur, Manoj Acharya +2Distribution Shift RobustnessMultimodal Large Language Models

  21. Latent Confidence Alignment for LLM Self-Assessment

    Jun 20, 2026Ting-Yu Chen, Tingting Yu, Pei-Cing Huang +3LLM EvaluationConfidence Estimation in Language Models

  22. Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

    Jun 18, 2026Yuetian Du, Yucheng Wang, Ming Kong +4Multimodal QALanguage Model Calibration