LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Which Models Perform Better in Inheritance Reasoning?

    Jun 11, 2026Mohammed Amine Mouhoub, Chahinez BouchekifLLM EvaluationLLM Reliability

  2. (Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable

    Jun 11, 2026Chen Zhu, Xiaolu Wang, Weilong ZhangAI Agent ReliabilityAI-Assisted Scientific Research

  3. Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

    Jun 10, 2026Hongjian Zhou, Xinyu Zou, Jinge Wu +19LLM ReliabilityMedical QA

  4. Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

    Jun 10, 2026Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski +7LLM EvaluationLLM Reliability

  5. Flaws in the LLM Automation Narrative

    Jun 9, 2026George Perrett, Javae Elliott, Jennifer Hill +1LLM EvaluationCode Generation

  6. PhantomBench: Benchmarking the Non-existential Threat of Language Models

    Jun 9, 2026Haeji Jung, Hila GonenLLM EvaluationHallucination in Language Models

  7. Code Is More Than Text: Uncertainty Estimation for Code Generation

    Jun 8, 2026Yuling Shi, Caiqi Zhang, Yuexian Li +4Confidence Estimation in Language ModelsLLM Reliability

  8. Measurement Under Selection: Decoy-Calibrated Failure Audits for Language Models

    Jun 8, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan SinghLLM EvaluationLanguage Model Error Detection

  9. Constrained Paraphrase Consistency for LLM Hallucination Detection

    Jun 6, 2026Shanshan Lin, Dongsheng Hong, Sibo Ju +3LLM ReliabilityLLM Hallucination Detection

  10. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  11. How reliable are LLMs when it comes to playing dice?

    Jun 5, 2026Luca Avena, Gianmarco Bet, Bernardo BusoniLLM EvaluationLLM Prompting

  12. How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

    Jun 4, 2026Tanvi Thoria, Kiana Jafari, Marc R. Schlichting +1Language Model Error DetectionLLM Reliability

  13. Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

    Jun 4, 2026Victor De Marez, Luna De Bruyne, Walter DaelemansLLM EvaluationLLM Sycophancy

  14. When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

    Jun 4, 2026Dongsheng Zhu, Xuchen Ma, Yucheng Shen +5AI Agent ReliabilityAI Agent Benchmarks

  15. CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction

    Jun 4, 2026Mohammad Anas Jawad, Cornelia CarageaConfidence Estimation in Language ModelsLanguage Model Calibration

  16. Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair

    Jun 3, 2026Zehua Cheng, Wei Dai, Jiahao Sun +1LLM Self-CorrectionSymbolic Reasoning

  17. Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

    Jun 2, 2026Johanne Medina, Tianyi Zhou, Keivin Isufaj +2Uncertainty QuantificationConfidence Estimation in Language Models

  18. Conformal Language Modeling via Posterior Sampling

    Jun 2, 2026Nicolas Emmenegger, Theo X. Olausson, Armando Solar-Lezama +1Hallucination in Language ModelsConformal Prediction

  19. Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

    Jun 2, 2026Malia Barker, Bishal Lakha, Edoardo Serra +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  20. Large Language Models Are Overconfident in Their Own Responses

    Jun 2, 2026Mario Sanz-Guerrero, Manuel Mager, Katharina von der WenseConfidence Estimation in Language ModelsLLM Prompting

  21. Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

    Jun 2, 2026Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed +1Multilingual Language Model EvaluationLLM Evaluation