LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Validating LLMs in social science: Epistemic threats and emerging norms

    Jul 8, 2026Meera Desai, Dallas Card, Abigail Z. JacobsLLM EvaluationComputational Social Science

  2. Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

    Jul 7, 2026Niels Potters, Theo HofmanLLM EvaluationLLM Auditing

  3. Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

    Jul 6, 2026MY Pitsane, Hope MogaleLLM Answer VerificationLLM Inference

  4. Mechanism-level routing failure in LLMs over Lean-verified algebraic structures

    Jul 5, 2026Manuel Israel Cázares, Wenlin Zhang, Haobo MaLLM ReliabilityLLM Routing

  5. Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

    Jul 4, 2026Diego Cerda-Mardini, Sarath Chandar, Sreenath MadathilLLM EvaluationProbability Calibration

  6. Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

    Jul 4, 2026Hanqing Wang, Yongdong Chi, Jian Yang +4LLM SecurityText-to-SQL

  7. Aligning Language Models with Selective Prediction

    Jul 3, 2026Gaoxiang Luo, Yifan Wu, Sinian Zhang +2RL for Language ModelsLLM Alignment

  8. Improving LLMs via Validator-to-Generator Alignment

    Jul 2, 2026Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk +1LLM AlignmentLLM Reliability

  9. CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning

    Jul 2, 2026Dingling Xu, Ruobing Wang, Qingfei Zhao +8LLM ReliabilityLLM Reasoning

  10. On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain

    Jul 1, 2026Atsuki Yamaguchi, Szymon Palucha, Léo Bijar +2Mixture-of-Experts PruningLLM Reliability

  11. Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions

    Jul 1, 2026César Guerra-Solano, Xiang Lorraine LiLLM EvaluationLanguage Model Generation Evaluation

  12. The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

    Jul 1, 2026Zhichao Fan, Yanhang Li, Zexin Zhuang +2LLM Safety BenchmarksLLM Evaluation

  13. When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

    Jun 30, 2026Yuqing Yang, Qi Zhu, Zhen Han +5LLM EvaluationLLM Grounding

  14. CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

    Jun 30, 2026Ajmal M., Abin Roy, Afthab Salam Kanniyan +4LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  15. CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

    Jun 30, 2026Yuchen Huang, Xiang Li, Zhenqing Ling +5LLM EvaluationInstruction Following

  16. Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns

    Jun 29, 2026Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto +5Software EngineeringLLM Evaluation

  17. Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection

    Jun 29, 2026Asif Shahriar, Hongyu Cai, Hadjer Benkraouda +2Software Vulnerability DetectionAdversarial Attacks on LLMs

  18. Can LLMs Rank? A Tale of Triads and Triage

    Jun 29, 2026Gaurab Pokharel, Shafkat Farabi, Patrick J. Fowler +1Pairwise ComparisonSocial Choice Theory

  19. Structural Certification for Reliable Physical Design with Language Models

    Jun 29, 2026Nakul Vyas, Iliya D. StoevLLM Answer VerificationFormal Verification