LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs

    Apr 21, 2026Clara Lachenmaier, Hannah Bultmann, Sina ZarrießLLM Self-CorrectionHuman-AI Interaction

  2. AI scientists produce results without reasoning scientifically

    Apr 20, 2026Martiño Ríos-García, Nawaf Alampara, Chandan Gupta +5AI Agent ReliabilityScientific Reasoning

  3. Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Large Language Models

    Apr 20, 2026Lin YaoLLM Self-CorrectionMulti-Token Prediction

  4. Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA

    Apr 19, 2026Alberto Testoni, Iacer CalixtoHealthcareSocial Bias in Language Models

  5. Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

    Apr 19, 2026Jingyi Ren, Ante Wang, Yunghwei Lai +5LLM EvaluationSelective Prediction

  6. Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

    Apr 19, 2026Yunkai Dang, Yifan Jiang, Yizhu Jiang +3Selective PredictionConfidence Estimation in Language Models

  7. Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification

    Apr 18, 2026Kimia Hamidieh, Veronika Thost, Walter Gerych +2Selective PredictionConfidence Estimation in Language Models

  8. No-Worse Context-Aware Decoding: Preventing Neutral Regression in Context-Conditioned Generation

    Apr 17, 2026Yufei Tao, Ameeta AgrawalLanguage Model DecodingLLM Reliability

  9. Beyond Surface Statistics: Robust Conformal Prediction for LLMs via Internal Representations

    Apr 17, 2026Yanli Wang, Peng Kuang, Xiaoyu Han +2Confidence Estimation in Language ModelsConformal Prediction

  10. LLMs Corrupt Your Documents When You Delegate

    Apr 17, 2026Philippe Laban, Tobias Schnabel, Jennifer NevilleLLM ReliabilityLong-Horizon LLM Agents

  11. IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation

    Apr 16, 2026Haozhi Fan, Jinhao Duan, Kaidi XuUncertainty QuantificationLanguage Model Generation Evaluation

  12. Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options

    Apr 16, 2026Nahyun Lee, Guijin SonLLM EvaluationMultiple-Choice Question Answering

  13. Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis

    Apr 15, 2026Zipeng Ling, Shuliang Liu, Seonil Son +4Logical ReasoningSelf-Consistency Decoding

  14. The Anatomy of Uncertainty in LLMs

    Mar 26, 2026Aditya Taparia, Ransalu Senanayake, Kowshik Thopalli +1LLM AuditingLLM Reliability

  15. Verify to Amplify: Improving Reasoning via Learned Chain-of-Thought Verification

    Mar 3, 2026Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia +2LLM EvaluationLLM Answer Verification

  16. Probing for Knowledge Attribution in Large Language Models

    Feb 26, 2026Ivo Brink, Alexander Boer, Dennis UlmerLLM InterpretabilityHallucination in Language Models

  17. ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization

    Feb 17, 2026Junbo Jacob Lian, Yujun Sun, Huiling Chen +3LLM-Based Program SynthesisLLM Reliability

  18. On Calibration of Large Language Models: From Response To Capability

    Feb 14, 2026Sin-Han Yang, Cheng-Kuang Wu, Chieh-Yen Lin +3LLM EvaluationConfidence Estimation in Language Models

  19. Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"

    Feb 4, 2026Dhruv Madhwal, Lyuxin David Zhang, Dan Roth +2LLM PromptingQuestion Decomposition