LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

    Jun 21, 2026Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari +2LLM EvaluationLanguage Model Generation Evaluation

  2. Evaluating LLMs for Real-World Web Vulnerability Detection

    Jun 19, 2026Sebastian Neef, Luca Jungnickel, Antonio Benjamin Buchholz +2Software Vulnerability DetectionLLM Reliability

  3. Peeking Inside LLMs: Leveraging Internal Artifacts of LLMs for Enhancing Reliability in Legal Classification

    Jun 18, 2026Sudipta Santra, Debtanu Datta, Saptarshi GhoshLegal NLPLanguage Model Error Detection

  4. Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

    Jun 18, 2026Yuetian Du, Yucheng Wang, Ming Kong +4Multimodal QALanguage Model Calibration

  5. A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models

    Jun 18, 2026Jiayi Wang, Xu-Yao ZhangLLM EvaluationUncertainty Quantification

  6. Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

    Jun 17, 2026Justin D. Norman, Michael U. Rivera, D. Alex HughesInter-Rater ReliabilityLLM Evaluation

  7. Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond

    Jun 16, 2026Hobin Kim, Xiaoyuan Wu, Omer Akgul +2LLM AuditingLLM Reliability

  8. From Drift to Coherence: Stabilizing Beliefs in LLMs

    Jun 16, 2026SongEun Kim, Seungyoo Lee, Edwin Fong +2LLM Fine-TuningBayesian Inference

  9. Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs

    Jun 16, 2026Dong Huang, Jianbo Sun, Pengkun YangLLM EvaluationPairwise Comparison

  10. Understanding LLMs in Title-Abstract Screening: From Disagreements to Recommendations

    Jun 16, 2026Mika Mäntylä, Patricia Matsubara, Katia Romero Felizardo +5LLM EvaluationEvidence Selection

  11. The Consistency Dilemma in LLMs: Generator-Evaluator Agreement and Vulnerability to Mistakes

    Jun 16, 2026Marina Mancoridis, Zoë HitzigLLM EvaluationReasoning Consistency in Language Models

  12. Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty

    Jun 15, 2026Baishali Chaudhury, Mengdie Flora Wang, Hyunji Hayley Park +3Reasoning Consistency in Language ModelsLLM Reliability

  13. Using AI in engineering education: a balancing act, driven by clear purpose

    Jun 15, 2026Olya KudinaAI in EducationGenerative AI in Education

  14. Know Your Limits : On the Faithfulness of LLMs as Solvers and Autoformalizers in Legal Reasoning

    Jun 15, 2026Olivia Peiyu Wang, Sanna Wong-Toropainen, Daneshvar Amrollahi +4LLM ReliabilityAutoformalization

  15. Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

    Jun 14, 2026Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli +1LLM EvaluationLLM Reliability

  16. The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages

    Jun 14, 2026Miso Choi, Seonga Choi, Mincheol Kwon +3LLM GroundingLLM Interpretability

  17. LLM-Assisted Stance Detection in Scientific Discourse: A Test Case in Bayesian Cognitive Science

    Jun 14, 2026Eyup Engin Kucuk, Tarik Kelestemur, Ömer Dağlar TanrikuluStance DetectionLLM-Assisted Annotation

  18. Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

    Jun 12, 2026Alyssa Unell, Natalie Dullerud, Naomi Boneh +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  19. CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

    Jun 12, 2026Juming Xiong, Weixin Liu, Kevin Guo +9CoT ReasoningRL for Language Model Reasoning

  20. Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models

    Jun 12, 2026Sangwhan Moon, Daisuke Oba, Youmi Ma +2Byte-Level Language ModelLLM Reliability

  21. Operadic consistency: a label-free signal for compositional reasoning failures in LLMs

    Jun 11, 2026Nathaniel Bottman, Yinhong Liu, Kyle RichardsonCompositional ReasoningReasoning Consistency in Language Models