LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable

    Sep 3, 2026Shai Vardi, João SedocLLM ReliabilityLLM Decision-Making

  2. The Dice Roll Method: A Standardized Protocol for Repeated-Query Auditing of Large Language Model Brand Recommendations

    Sep 3, 2026Dmitrij ŻatuchinLLM AuditingLLM Reliability

  3. Inferred Generative-Process Diversity Predicts Correlated Failure Across Language Models

    Sep 3, 2026Ross Tieman, Evan MarkouLLM ReliabilityLanguage Model Ensembles

  4. Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

    Sep 3, 2026Yuhe Wu, Guangyu Wang, Yujie Chen +7Moral Reasoning in Language ModelsLLM Reliability

  5. Knowing Is Not Enough: Information Retrievability as a Precondition to Effective LLM Oversight

    Sep 2, 2026Xinyu Fu, Narayan Ramasubbu, Dennis GallettaLLM ReliabilityHuman Oversight of AI

  6. LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs

    Sep 1, 2026Muhammed Saeed, Simon RazniewskiLLM EvaluationLLM Auditing

  7. Towards a Reliable and Practical Eval Pipeline

    Sep 1, 2026Emma Thuong Nguyen, Abhishek GhoseLLM EvaluationLLM-as-a-Judge

  8. Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

    Aug 31, 2026Yue Zhou, Yuan Wu, Yi ChangVLM EvaluationLarge Vision-Language Models

  9. WildSEEK: Evaluating Language Models for Information-Seeking

    Aug 31, 2026Tanise Ceron, Joachim Baumann, Elisa Bassignana +3LLM Safety BenchmarksLLM Sycophancy

  10. Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation

    Aug 31, 2026Ante Kapetanovic, Tomislav Duricic, Andro Mercep +1LLM EvaluationLLM Reranking

  11. More Capable, Less Faithful: A Multilingual Analysis of Mathematical (Un)Solvability Detection in LLMs

    Aug 31, 2026Maria-Eleni Zoumpoulidi, Nikolaos Xiros, Georgios ParaskevopoulosMultilingual Language Model EvaluationLLM Reliability

  12. Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records

    Aug 30, 2026Nora Girda, Adrian GrozaData ProvenanceLLM Reliability

  13. EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning

    Aug 30, 2026Peilin Liu, Zhiquan Ji, Jinglong PingEvidence-Grounded ReasoningLLM Reliability

  14. Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered

    Aug 29, 2026Aryo Pradipta Gema, Neel Rajani, Rohit Saxena +2CoT FaithfulnessLLM Auditing

  15. Validating FKG.in: Soundness Assessment in LLM-Augmented Indian Food Knowledge

    Aug 29, 2026Saransh Kumar Gupta, Armaan Shah, Lipika Dey +2LLM AuditingLLM Reliability

  16. Credal Large Language Models for Semantic Commitment under Uncertainty

    Aug 24, 2026Shireen Kudukkil Manchingal, Sofiia Nikolenko, Fabio CuzzolinSelective PredictionConfidence Estimation in Language Models

  17. Decomposing Wrong-Consensus Agreement in LLM Self-Consistency

    Aug 19, 2026Lizhuo Zhang, Mengmeng Tang, Chenfeng Long +2LLM EvaluationLLM Reliability

  18. Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection

    Aug 18, 2026Bin Li, Dongdong Wang, Siyang LuPost-Hoc CalibrationOnline Anomaly Detection

  19. CAPRI: Contract-Aware Proof Repair for Isabelle

    Aug 13, 2026Jim Woodcock, Gabriel Leite, Augusto Sampaio +1LLM AuditingInteractive Theorem Proving

  20. Self-Referential Induction Increases Response Instability Relative to Unresolvable and Verifiable Questions in Large Language Models

    Aug 13, 2026Paras Balani, Subhrakanta PandaLLM PromptingLLM Reliability

  21. Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

    Aug 12, 2026Haoyuan ZhuInstruction FollowingLLM Reliability

  22. Is this Citation on Point?

    Aug 12, 2026Apurv VermaLegal Citation VerificationLLM Reliability

  23. NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

    Aug 12, 2026Jiarui Ma, Jianghan Wang, Yuheng Ma +2LLM EvaluationBenchmark Design

  24. TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

    Aug 11, 2026Valentin Rodionov, Shamil AssylbekovLLM EvaluationLLM Reliability