LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction

    May 4, 2026Florian Geissler, Francesco Carella, Laura Fieback +1Retrieval-Augmented GenerationFactual Consistency Evaluation

  2. What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models

    May 3, 2026Ranit Karmakar, Jayita ChatterjeeLLM EvaluationLanguage Model Calibration

  3. Language models fail at extended rule following

    May 3, 2026Tianxiang Dai, Jonathan FanLLM EvaluationLLM Reliability

  4. Only Say What You Know: Calibration-Aware Generation for Long-Form Factuality

    May 3, 2026Wen Luo, Guangyue Peng, Liang Wang +7Long-Form Document GenerationLLM Hallucination Mitigation

  5. Hallucinations Undermine Trust; Metacognition is a Way Forward

    May 2, 2026Gal Yona, Mor Geva, Yossi MatiasLLM Hallucination MitigationHallucination in Language Models

  6. CLEAR: Revealing How Noise and Ambiguity Degrade Reliability in LLMs for Medicine

    May 1, 2026Kevin H. Guo, Chao Yan, Avinash Baidya +5HealthcareLLM Reliability

  7. "I Don't Know" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation

    May 1, 2026Daan Di Scala, Maaike de Boer, Pınar YolumRetrieval-Augmented GenerationLLM Reliability

  8. Geometry-Calibrated Conformal Abstention for Language Models

    Apr 30, 2026Rui Xu, Yi Chen, Sihong Xie +1Uncertainty QuantificationSelective Prediction

  9. Belief-Guided Inference Control for Large Language Model Services via Verifiable Observations

    Apr 30, 2026Wenhao Yuan, Chenchen Lin, Jian Chen +3LLM InferenceCost-Aware Inference

  10. MoRFI: Monotonic Sparse Autoencoder Feature Identification

    Apr 29, 2026Dimitris Dimakopoulos, Shay B. Cohen, Ioannis KonstasLLM Hallucination MitigationLLM Interpretability

  11. From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data

    Apr 29, 2026Md. Rejaul Korim Sadi, Toufiqur Rahman Tasin, Golam Mostofa NaeemHallucination in Language ModelsLLM Reliability

  12. HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models

    Apr 28, 2026Guoshenghui Zhao, Tan Yu, Weijie ZhaoHallucination DetectionHallucination in Language Models

  13. Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors

    Apr 28, 2026Long Zhang, Zi-bo Qin, Wei-neng ChenKnowledge Conflicts in Language ModelsLLM Auditing

  14. An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

    Apr 27, 2026Hikmat Karimov, Rahid Zahid AlekberliLLM EvaluationLLM Reliability

  15. Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning

    Apr 27, 2026Ibne Farabi Shihab, Sanjeda Akter, Anuj SharmaContinual Learning for LLMsConformal Prediction

  16. Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

    Apr 24, 2026Prakul Sunil Hiremath, Harshit R. HiremathConfidence Estimation in Language ModelsCoT Reasoning

  17. How Large Language Models Balance Internal Knowledge with User and Document Assertions

    Apr 24, 2026Shuowei Li, Haoxin Li, Wenda Chu +1LLM SycophancyKnowledge Augmentation for Language Models

  18. When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure

    Apr 23, 2026Boyu Xiao, Xiuqi Tian, Xuwen Song +4LLM SycophancyHealthcare

  19. Differentiable Conformal Training for LLM Reasoning Factuality

    Apr 22, 2026Nathan Hittesdorf, Marco Salzetta, Lu ChengLLM Hallucination MitigationConformal Prediction

  20. Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders

    Apr 21, 2026Het Patel, Tiejin Chen, Hua Wei +2LLM InterpretabilityLLM Reliability