LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

    Jul 23, 2026Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar +1LLM EvaluationText Summarization

  2. LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

    Jul 23, 2026Yunhan Li, Mingjie Xie, Zeyang Shi +2Legal Citation VerificationCitation Verification

  3. Task Competence Is Not Instruction Following: Evaluating Instruction-Conflicting Behavior in Small Language Models

    Jul 21, 2026Mahdiyeh Farajidizaji, Vatsal RainaLLM EvaluationInstruction Following

  4. Using Fine-Tuned LLMs to Identify Indicators of Vulnerability in UK Police Incident Logs

    Jul 20, 2026Sam Relins, Daniel BirksLLM Reliability

  5. PEARL: Auditable Repair for Scientific Reasoning Graph Extraction

    Jul 20, 2026Bohan Su, Pengze Li, Yuchen Lu +1LLM Reasoning with GraphsLLM Auditing

  6. FailureAtlas: A Taxonomy of Failure Modes in Multi-Provider LLM Serving Infrastructure

    Jul 20, 2026Vishal Pandey, Gopal SinghLLM ServingLLM Reliability

  7. An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation

    Jul 19, 2026Zhanbo Li, Shifeng Wu, Xiangjin Meng +1LLM GroundingCounterfactual Reasoning in Language Models

  8. Debate-on-Graph: Reliable and Adaptive Reasoning of Large Language Model on Uncertain Knowledge Graph

    Jul 19, 2026Peiji Yu, Xin Chen, Tianxing WuKnowledge Augmentation for Language ModelsMulti-Agent Debate

  9. KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding

    Jul 19, 2026Timur Turatali, Aida Turdubaeva, Rustem Izmailov +2Multilingual Language Model EvaluationLLM Reliability

  10. Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification

    Jul 18, 2026Yanni Dong, Minghua Liu, Meilin Zhu +2Reasoning Consistency in Language ModelsLLM Reliability

  11. ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

    Jul 17, 2026Vishal Pandey, Gopal SinghLLM ServingLLM Reliability

  12. Harnessing LLMs for Reliable Academic Supervision: A Comparative Study

    Jul 16, 2026Akash RajLLM ReliabilityLLM Agent Harnesses

  13. Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers

    Jul 14, 2026Dmitrij ŻatuchinMultilingual Language Model EvaluationLLM Reliability

  14. Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling

    Jul 14, 2026Roi Cohen, Yvan Carré, Nick Lechtenbörger +5Language Model PretrainingLLM Grounding

  15. Do LLMs Fabricate Legal Citations? A Bilingual Benchmark on Saudi Data Protection Law and the GDPR

    Jul 13, 2026Noura Suliman AlrajehLegal Citation VerificationLLM Reliability

  16. Reliability Scaling Laws for Quantized Large Language Models

    Jul 12, 2026Sirine Ayadi, Sándor Daróczi, Stephan Günnemann +1LLM QuantizationLanguage Model Calibration

  17. Weight-Adjusted Gradients Reveal Parameter Importance and Failure Modes in LLMs

    Jul 12, 2026Shrestha Datta, Hongfu Liu, Anshuman ChhabraGradient-Based AttributionLLM Interpretability

  18. Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

    Jul 10, 2026Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry WuLLM QuantizationLLM Evaluation

  19. The Patchwork Problem in LLM-Generated Code

    Jul 9, 2026Viraaji Mothukuri, Reza M. PariziStatic Code AnalysisLLM Reliability