LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds

    Jul 31, 2026Yefan Tao, Gerald Friedland, Madhusudhanan Chandrasekaran +1LLM Self-CorrectionLLM Self-Refinement

  2. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

    Jul 30, 2026Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia +2LLM ReliabilityLanguage Model Editing

  3. When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence

    Jul 30, 2026Zongheng Guo, Tao Chen, Tianli Li +6LLM EvaluationLLM Reliability

  4. LLMs struggle to simulate human belief updates in controlled environments

    Jul 30, 2026Sebastian Pohl, Harsh Mehta, Pranav Mambayil +4Human Behavior SimulationLLM Reliability

  5. GGC: Selective Query Correction for Reliable Text-to-SPARQL Generation

    Jul 30, 2026Ziyi Yang, Thanh-Son Nguyen, Tuan Anh Nguyen +1LLM Self-CorrectionLLM Reliability

  6. Position: Evaluation Scores Are Perishable Knowledge Claims

    Jul 28, 2026Sankalp Gilda, Shlok GildaLLM EvaluationLLM Reliability

  7. How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

    Jul 28, 2026Ramtin Ehsani, Irene Manotas, Saurabh Pujar +2Automated Program RepairLLM Interpretability

  8. Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

    Jul 28, 2026Federico Cabitza, Gianluca ColomboHuman-AI InteractionLLM Reliability

  9. Many-body Tipping Dynamics of ChatGPT-like AIs

    Jul 28, 2026Frank Yingjie Huo, Neil F. JohnsonLLM ReliabilityLLM Safety

  10. CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models

    Jul 27, 2026Mingxuan SunRelation ExtractionDocument Understanding

  11. Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

    Jul 27, 2026Zongyou Yang, Yinghan HouLLM EvaluationLLM Answer Verification

  12. Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs

    Jul 26, 2026Jiwon Moon, Yerin Hwang, Kyomin JungMultilingual Language Model EvaluationLLM Security

  13. Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

    Jul 24, 2026Jian Lu, Panyu Chen, Miriam Treggiari +5LLM ReliabilityClinical Language Model Evaluation

  14. Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model

    Jul 24, 2026Robab Aghazadeh Chakherlou, Siddartha Khastgir, Peter Popov +1LLM EvaluationHierarchical Bayesian Modeling

  15. Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

    Jul 24, 2026Davide Scarso, Hugo Noronha de Almeida, Joaquim PinaLLM EvaluationLLM Auditing

  16. Semiotic logical hexagon theory for LLM logical reasoning

    Jul 24, 2026Yunyao Zhang, Xinglang Zhang, Zeliang Chen +2Logical ReasoningLLM Reliability

  17. Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

    Jul 23, 2026Ramesh B. ParamkushamLanguage Model Safety EvaluationDomain Adaptation

  18. Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

    Jul 23, 2026Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar +1LLM EvaluationText Summarization

  19. LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

    Jul 23, 2026Yunhan Li, Mingjie Xie, Zeyang Shi +2Legal Citation VerificationCitation Verification