LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Reproducible LLM Inference Benchmarking: A Sequential Isolation Protocol for Regression Testing

    Oct 7, 2026Arnold Olympio, Juan Manuel Servera Bondroit, Wael Abdelmalek +2LLM InferenceML Reproducibility

  2. InsClaimBench: Benchmarking Insurance Claim Adjudication Across the Decision Chain

    Oct 7, 2026Linqi Zhang, Chong Qi, Yan Cheng +4AI-Assisted Decision MakingLLM Evaluation

  3. How Do LLMs Change Predictions Under Negation?

    Oct 7, 2026Jongwook Yoon, Jongwon Lim, Sungjib Lim +2LLM ReliabilityLLM Evaluation

  4. Reliability of LLM Judges for Evaluating Entity Alignment

    Oct 7, 2026Vaibhava Lakshmi Ravideshik, Mayank KejriwalLLM-as-a-JudgeBias in LLM-as-a-Judge

  5. Agreement Is Not Validity: Cross-Model LLM Consensus in Diagnosing Student Failure Modes in K-12 Math Tutoring Dialogue

    Oct 6, 2026Clayton Cohn, Joyce Fonteles, Kirk Vanacore +5LLM EvaluationLLM-Assisted Annotation

  6. Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices

    Oct 6, 2026Jinhyeok Kim, Hye-Young JungLLM EvaluationMultiple-Choice Question Answering

  7. Errors of LLM-Assisted Literature Retrieval in Environmental Science: A Comparison Study of Abstract versus Full-text Based Prompts

    Oct 5, 2026Yanjun Chen, Yongfeng Zhang, Lanjing ZhangLLM PromptingLLM Reliability

  8. Hallucination Across the Reasoning Lifecycle: Interface Visibility, Causal Evidence, and Release Control in Large Reasoning Models

    Oct 4, 2026Zhe Yu, Mohan Li, Lei Yu +6LLM Hallucination MitigationHallucination in Language Models

  9. VERA: Verdict-Conditioned Reliability for Adaptive LLM Judges

    Oct 4, 2026Qiushui Xu, Syamil Mohd Razak, Tao Yuan +1LLM-as-a-JudgeLLM Fine-Tuning

  10. How Much Do LLM-as-a-Judge Design Choices Matter? A Systematic Comparison of Prompt Designs, Rating Scales, and Models

    Oct 4, 2026Laurène Vaugrante, Thilo HagendorffLLM EvaluationLLM-as-a-Judge

  11. Understanding Errors in LLM-Based Question Answering over Imperfect Tables

    Oct 3, 2026Baowen Zhang, Wei Fan, Ruman Wang +1Table QALanguage Model Error Detection

  12. Can LLMs Reliably Annotate Bioassay Metadata to Improve Data Readiness?

    Oct 1, 2026Laura van Weesep, Riccardo Tedoldi, Jens Sjölund +6LLM AuditingLLM-Assisted Annotation

  13. How the Audit Rule Shapes Faithful Factor Explanations in LLMs

    Oct 1, 2026Taolin Zhang, Hanyu Wang, Jiuheng Wan +2Counterfactual ExplanationsFaithfulness of Language Model Explanations

  14. Evaluating LLM-Generated Preference Distributions

    Oct 1, 2026Fan Huang, Minsuk Kim, C. Tyler Diggans +1LLM EvaluationSynthetic Data Generation

  15. Predicting Multi-View Rashomon Representation: Can We Learn Where Models Disagree?

    Sep 30, 2026Mingyue Ma, Zongbo Han, Changqing Zhang +1Multi-View ConsistencyLLM Reliability

  16. Stress-Testing LLM Lie Detectors: Role-Play Failures and Spurious Correlations

    Sep 30, 2026Maximilian von Klinski, Sebastian Lapuschkin, Wojciech Samek +1Deception in Language ModelsLLM Reliability

  17. Also Small Models Can Reasonably Self-Evaluate Their Confidence

    Sep 30, 2026Idil Kapikiran, Thomas Decker, Thomas RunklerConfidence Estimation in Language ModelsSmall Language Models

  18. Complexity-Aware Evaluation of LLM Comprehension

    Sep 29, 2026Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. AjilaSoftware EngineeringLLM Evaluation

  19. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  20. Multi-Channel Mitigation of Source-Trust Shortcuts in Fact-Checking RL Agents

    Sep 29, 2026Jianchang Su, Yiwei Yang, Wei ZhangAutomated Fact-CheckingLLM Reliability