LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Reproducible LLM Inference Benchmarking: A Sequential Isolation Protocol for Regression Testing

    Oct 7, 2026Arnold Olympio, Juan Manuel Servera Bondroit, Wael Abdelmalek +2LLM InferenceML Reproducibility

  2. InsClaimBench: Benchmarking Insurance Claim Adjudication Across the Decision Chain

    Oct 7, 2026Linqi Zhang, Chong Qi, Yan Cheng +4AI-Assisted Decision MakingLLM Evaluation

  3. How Do LLMs Change Predictions Under Negation?

    Oct 7, 2026Jongwook Yoon, Jongwon Lim, Sungjib Lim +2LLM ReliabilityLLM Evaluation

  4. Reliability of LLM Judges for Evaluating Entity Alignment

    Oct 7, 2026Vaibhava Lakshmi Ravideshik, Mayank KejriwalLLM-as-a-JudgeBias in LLM-as-a-Judge

  5. Agreement Is Not Validity: Cross-Model LLM Consensus in Diagnosing Student Failure Modes in K-12 Math Tutoring Dialogue

    Oct 6, 2026Clayton Cohn, Joyce Fonteles, Kirk Vanacore +5LLM EvaluationLLM-Assisted Annotation

  6. Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices

    Oct 6, 2026Jinhyeok Kim, Hye-Young JungLLM EvaluationMultiple-Choice Question Answering

  7. Errors of LLM-Assisted Literature Retrieval in Environmental Science: A Comparison Study of Abstract versus Full-text Based Prompts

    Oct 5, 2026Yanjun Chen, Yongfeng Zhang, Lanjing ZhangLLM PromptingLLM Reliability

  8. Hallucination Across the Reasoning Lifecycle: Interface Visibility, Causal Evidence, and Release Control in Large Reasoning Models

    Oct 4, 2026Zhe Yu, Mohan Li, Lei Yu +6LLM Hallucination MitigationHallucination in Language Models

  9. VERA: Verdict-Conditioned Reliability for Adaptive LLM Judges

    Oct 4, 2026Qiushui Xu, Syamil Mohd Razak, Tao Yuan +1LLM-as-a-JudgeLLM Fine-Tuning

  10. How Much Do LLM-as-a-Judge Design Choices Matter? A Systematic Comparison of Prompt Designs, Rating Scales, and Models

    Oct 4, 2026Laurène Vaugrante, Thilo HagendorffLLM EvaluationLLM-as-a-Judge

  11. Understanding Errors in LLM-Based Question Answering over Imperfect Tables

    Oct 3, 2026Baowen Zhang, Wei Fan, Ruman Wang +1Table QALanguage Model Error Detection

  12. Can LLMs Reliably Annotate Bioassay Metadata to Improve Data Readiness?

    Oct 1, 2026Laura van Weesep, Riccardo Tedoldi, Jens Sjölund +6LLM AuditingLLM-Assisted Annotation

  13. How the Audit Rule Shapes Faithful Factor Explanations in LLMs

    Oct 1, 2026Taolin Zhang, Hanyu Wang, Jiuheng Wan +2Counterfactual ExplanationsFaithfulness of Language Model Explanations

  14. Evaluating LLM-Generated Preference Distributions

    Oct 1, 2026Fan Huang, Minsuk Kim, C. Tyler Diggans +1LLM EvaluationSynthetic Data Generation

  15. Predicting Multi-View Rashomon Representation: Can We Learn Where Models Disagree?

    Sep 30, 2026Mingyue Ma, Zongbo Han, Changqing Zhang +1Multi-View ConsistencyLLM Reliability

  16. Stress-Testing LLM Lie Detectors: Role-Play Failures and Spurious Correlations

    Sep 30, 2026Maximilian von Klinski, Sebastian Lapuschkin, Wojciech Samek +1Deception in Language ModelsLLM Reliability

  17. Also Small Models Can Reasonably Self-Evaluate Their Confidence

    Sep 30, 2026Idil Kapikiran, Thomas Decker, Thomas RunklerConfidence Estimation in Language ModelsSmall Language Models

  18. Complexity-Aware Evaluation of LLM Comprehension

    Sep 29, 2026Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. AjilaSoftware EngineeringLLM Evaluation

  19. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  20. Multi-Channel Mitigation of Source-Trust Shortcuts in Fact-Checking RL Agents

    Sep 29, 2026Jianchang Su, Yiwei Yang, Wei ZhangAutomated Fact-CheckingLLM Reliability

  21. How Much Prompt Is Enough? A Blackbox Minimization of Few-Shots in LLMs

    Sep 28, 2026Ali Alfageeh, Rahul Gopinath, Amin AlipourLLM PromptingFew-Shot Prompting

  22. A Polyphonic Conception of AI Understanding

    Sep 28, 2026Matthieu Queloz, Pierre BeckmannLLM InterpretabilityLLM Reliability

  23. Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation

    Sep 28, 2026Fahrell Giovanny, Geby Bayuningtyas, Sahrul Mukharom +1Knowledge Conflicts in Language ModelsAdversarial Attacks on LLMs

  24. Semantic Uncertainty Quantification Needs Factual Equivalence

    Sep 28, 2026Joseph Hoche, Quentin Guimard, Gianni FranchiConfidence Estimation in Language ModelsFactual Consistency Evaluation

  25. When Words Fall Short: Iterative Synergy Between Verbalized Reasoning and Hidden Features for LLM Confidence Estimation

    Sep 28, 2026Yekun Xu, Ante Wang, Jingyi Ren +3Confidence Estimation in Language ModelsLLM Reliability

  26. Toward a Graded Measure of Belief Stability in Large Language Models

    Sep 28, 2026Samantha Dies, Branden Fitelson, Tina Eliassi-RadLLM ReliabilityLLM Uncertainty Estimation

  27. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Reward ModelingLLM Reliability

  28. Feedback Makes Perfect: A Closed-Loop Framework for NL-to-STL Translation

    Sep 27, 2026Bowen Ye, Xiang YinSignal Temporal LogicLLM Reliability

  29. Beyond Average Safety: Chance-Constrained LLM Fine-tuning

    Sep 24, 2026Taha Entesari, Mahyar FazlyabStochastic OptimizationChance-Constrained Optimization

  30. Exact Feedback Is Not Control: Evaluating Text-based Closed-Loop Revision in LLMs

    Sep 23, 2026Haitong Jiang, Chunlin Liu, Yile Wang +1LLM Self-CorrectionControllable Text Generation

  31. Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference

    Sep 22, 2026Gaoyuan Du, Anam Nawaz Khan, Rex Zhou +4Language Model DecodingLLM Inference

  32. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLLM EvaluationConfidence Estimation in Language Models

  33. On the security and privacy of LLMs in Mobility

    Sep 22, 2026Mauro Conti, Lorenzo Perinello, Umberto SalviatiIntelligent Transportation SystemsLLM Security

  34. LLJ Cards: Best practices for the Use of LLMs as Judges

    Sep 21, 2026Khaoula Chehbouni, Melina Medjdoub, Florian Carichon +2LLM EvaluationLLM-as-a-Judge

  35. ChartJudgeBench: Evaluating LMM Judges for Chart-to-Code Generation

    Sep 21, 2026Lijian Wu, Henry Hengyuan Zhao, Zijian Zhang +3VLM EvaluationLLM Evaluation

  36. EnterpriseVal: Quantifying the Efficacy, Reliability and Value of Generative AI in the Enterprise

    Sep 18, 2026Abbas Raza Ali, Muhammad Ajmal Siddiqui, Moona ZahidHuman-in-the-Loop EvaluationLLM Reliability

  37. Intrinsic Sequence-Likelihood Confidence in Retrieval-Dominated Extractive QA: Two Pre-Specified Negatives, and What They Do and Do Not Attribute

    Sep 17, 2026Gunwoo Lee, Changmin Sung, Sang-Hwan Gwak +3LLM EvaluationSelective Prediction

  38. Reproducibility is not construct validity: LLM measurement of institutionally situated communication

    Sep 17, 2026Veronika Batzdorfer, Carlo Romano Marcello Alessandro SantagiustinaLLM EvaluationLLM-Assisted Annotation

  39. WaveTLM: Reliable Time-Series Language Modeling through Task Compilation

    Sep 16, 2026Jiahui Chen, Bingke Zhu, Hongyu Pan +1LLM ReliabilityTime-Series Foundation Models