LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. GYROval: A Robust Benchmark for Cultural Value Orientation in Large Language Models

    Sep 16, 2026Alexander Didenko, Anna Shabanova, Vladislav Zapylikhin +2LLM EvaluationCross-Cultural Language Model Evaluation

  2. An Empirical Evaluation of Cost-Efficient Large Language Models on Algorithmic Programming Tasks

    Sep 16, 2026Chandimal Adikari, Nandika HerathCode GenerationLLM Reliability

  3. An Empirical Study of Counterfactual Self-Explanations in LLMs

    Sep 15, 2026Giannis Kalyvas, Giorgos Filandrianos, Orfeas Menis Mastromichalakis +2Counterfactual ExplanationsFaithfulness of Language Model Explanations

  4. PRISMA-LLM: An Empirical Reporting Framework for AI-Assisted Systematic Reviews

    Sep 14, 2026Miguel Zabaleta, Baihan LinLLM AuditingAI-Assisted Scientific Research

  5. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  6. Competence-Gated Pooling of Language Models and Priors for Event Forecasting

    Sep 14, 2026Aditi Tiwari, Aashrith Bandaru, Heng JiEvent Time PredictionSelective Prediction

  7. Language Is an Insufficient Substrate for Quantitative Reasoning, and Consequential Domains Need Large Quantitative Models

    Sep 14, 2026Reuben Vandeventer, David Imrem, David J. WildNumerical Reasoning in Language ModelsLLM Reliability

  8. Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?

    Sep 14, 2026Obinna I. EkekezieCoreference ResolutionLLM Answer Verification

  9. Biomedical Reference Generation Remains Unreliable across 26 Large Language Models

    Sep 14, 2026Maxim Topaz, Zhihong Zhang, Nir Roguin +3LLM EvaluationHallucination in Language Models

  10. Towards a Deterministic Math Solver for Clinical Language Models

    Sep 12, 2026Felipe Ocampo Osorio, Sebastián Andrés Cajas Ordoñez, Maximin Lange +5Numerical Reasoning in Language ModelsLLM Reliability

  11. Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning

    Sep 12, 2026Bincheng Gu, Min Gao, Zongwei Wang +3Test-Time AdaptationLLM Reliability

  12. Can LLMs Normalize Databases? A Benchmark and Multi-Agent Framework for Schema Normalization

    Sep 11, 2026Dong-Jae Koh, Huisu Kim, SeongHwan Yoon +4Multi-Agent LLM SystemsLLM Reliability

  13. Legible Failures: Detecting and Repairing In-Context Binding Errors

    Sep 11, 2026Manas Venkata Sai Ravulapalli, Samrath Singh Chadha, Abhinav M. HariLanguage Model Error DetectionLLM Reliability

  14. INDRA: A New AI Tool for Exploring Tobacco, Fossil Fuel, and Chemical Industry Archives

    Sep 11, 2026Daniel Akselrad, Robert N. ProctorRetrieval-Augmented GenerationLLM Reliability

  15. If It's Not Buggy, Don't Fix It: On the Dynamics of Iterative Bug-fixing with LLMs

    Sep 9, 2026Xietao Wang-Lin, Anton Isopoussu, Louis MahonLLM Self-CorrectionAutomated Program Repair

  16. ProbPlug: A Plugin Uncertainty Network for Reliable Confidence in LLM Binary Classification

    Sep 9, 2026Jianzong Wang, Chuhang Liu, Botao Zhao +6Confidence Estimation in Language ModelsLanguage Model Calibration

  17. Stable Answers, Unfinished Reasoning: Why Self-Consensus Is Not a Safe Early-Exit Signal

    Sep 9, 2026Yunxiang Mo, Donghao Zhao, Hejia GengEarly StoppingLLM Reliability

  18. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReward ModelingReward Hacking

  19. When Models Defer to Wrong Answers: A Robustness Audit of Source-Attributed Cues in Multiple-Choice QA

    Sep 8, 2026Manikandan Ravikiran, Siddharth VohraMultiple-Choice Question AnsweringLLM Reliability

  20. API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

    Sep 8, 2026Jennifer Wang, Joachim Baumann, Daniel E. Ho +1LLM EvaluationLanguage Model Generation Evaluation

  21. Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks

    Sep 8, 2026Aymene Berriche, Cathrine Shalby, Mohannad Alhanahnah +1LLM EvaluationLLM Auditing

  22. FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect

    Sep 7, 2026Hazel H. Kim, Andrew M. Bean, Guilherme Affonso Ferreira de Camargo +10LLM EvaluationLLM Reliability

  23. Molecular Déjà Vu: Digit-Level Retrieval of Molecular Properties in Frontier Language Models

    Sep 4, 2026Matthias Busch, Marius Tacke, Sviatlana V. Lamaka +4LLM EvaluationLLM Reliability

  24. Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

    Sep 3, 2026Haoyaun Zhu, Jie ZhangLLM EvaluationLLM-as-a-Judge