LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks

    Aug 1, 2026Faizan Faisal, Prem Devanbu, Toufique AhmedReasoning DistillationLLM Prompting

  2. SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

    Aug 1, 2026Dahai Yu, Lin Jiang, Rongchao Xu +1Uncertainty QuantificationLLM Reliability

  3. Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds

    Jul 31, 2026Yefan Tao, Gerald Friedland, Madhusudhanan Chandrasekaran +1LLM Self-CorrectionLLM Self-Refinement

  4. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

    Jul 30, 2026Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia +2LLM ReliabilityLanguage Model Editing

  5. When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence

    Jul 30, 2026Zongheng Guo, Tao Chen, Tianli Li +6LLM EvaluationLLM Reliability

  6. LLMs struggle to simulate human belief updates in controlled environments

    Jul 30, 2026Sebastian Pohl, Harsh Mehta, Pranav Mambayil +4Human Behavior SimulationLLM Reliability

  7. GGC: Selective Query Correction for Reliable Text-to-SPARQL Generation

    Jul 30, 2026Ziyi Yang, Thanh-Son Nguyen, Tuan Anh Nguyen +1LLM Self-CorrectionLLM Reliability

  8. Position: Evaluation Scores Are Perishable Knowledge Claims

    Jul 28, 2026Sankalp Gilda, Shlok GildaLLM EvaluationLLM Reliability

  9. How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

    Jul 28, 2026Ramtin Ehsani, Irene Manotas, Saurabh Pujar +2Automated Program RepairLLM Interpretability

  10. Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

    Jul 28, 2026Federico Cabitza, Gianluca ColomboHuman-AI InteractionLLM Reliability

  11. Many-body Tipping Dynamics of ChatGPT-like AIs

    Jul 28, 2026Frank Yingjie Huo, Neil F. JohnsonLLM ReliabilityLLM Safety

  12. CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models

    Jul 27, 2026Mingxuan SunRelation ExtractionDocument Understanding

  13. Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

    Jul 27, 2026Zongyou Yang, Yinghan HouLLM EvaluationLLM Answer Verification

  14. Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs

    Jul 26, 2026Jiwon Moon, Yerin Hwang, Kyomin JungMultilingual Language Model EvaluationLLM Security

  15. Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

    Jul 24, 2026Jian Lu, Panyu Chen, Miriam Treggiari +5LLM ReliabilityClinical Language Model Evaluation

  16. Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model

    Jul 24, 2026Robab Aghazadeh Chakherlou, Siddartha Khastgir, Peter Popov +1LLM EvaluationHierarchical Bayesian Modeling

  17. Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

    Jul 24, 2026Davide Scarso, Hugo Noronha de Almeida, Joaquim PinaLLM EvaluationLLM Auditing

  18. Semiotic logical hexagon theory for LLM logical reasoning

    Jul 24, 2026Yunyao Zhang, Xinglang Zhang, Zeliang Chen +2Logical ReasoningLLM Reliability

  19. Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

    Jul 23, 2026Ramesh B. ParamkushamLanguage Model Safety EvaluationDomain Adaptation