LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling

    May 25, 2026Meng Cai, Lars Kulik, Farhana ChoudhurySelf-Consistency DecodingTest-Time Scaling

  2. Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

    May 24, 2026Yoav Gur-Arieh, Ana Marasović, Mor GevaCoT FaithfulnessLLM Evaluation

  3. Graph Alignment Topology as an Inductive Bias for Grounding Detection

    May 21, 2026Paul Landes, Pranav Herur, Adam Cross +1LLM GroundingHallucination in Language Models

  4. Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

    May 21, 2026Jewon Yeom, Jaewon Sok, Heejun Kim +3LLM InterpretabilityHallucination in Language Models

  5. Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

    May 20, 2026Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat MasoodLanguage Model Safety EvaluationHealthcare

  6. Reading Calibrated Uncertainty from Language Model Trajectories

    May 19, 2026Aliai Eusebi, Alexander Herzog, Xiaoyu Liang +3Confidence Estimation in Language ModelsLLM Reliability

  7. BalanceRAG: Joint Risk Calibration for Cascaded Retrieval-Augmented Generation

    May 19, 2026Zijun Jia, Yuanchang Ye, Sen Jia +6Retrieval-Augmented GenerationSelective Prediction

  8. LLM Benchmark Datasets Should Be Contamination-Resistant

    May 19, 2026Ali Al-Lawati, Jason Lucas, Dongwon Lee +1LLM EvaluationBenchmark Contamination

  9. Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

    May 19, 2026Xiaoou Liu, Tiejin Chen, Dengjia Zhang +3Uncertainty QuantificationConfidence Estimation in Language Models

  10. Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

    May 19, 2026Tiejin Chen, Longchao Da, Xiaoou Liu +1LLM EvaluationUncertainty Quantification

  11. Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning

    May 16, 2026Shuo Liu, Ding Liu, Shi-Ju RanConfidence Estimation in Language ModelsLLM Reliability

  12. Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning

    May 15, 2026Shireen Kudukkil Manchingal, Abhey Kalia, Fernanda Gonçalves +1LLM Answer VerificationEnergy-Based Models

  13. Calibrating LLMs with Semantic-level Reward

    May 15, 2026Fengfei Yu, Ruijia Niu, Dongxia Wu +2Language Model CalibrationLLM Reliability

  14. LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling

    May 14, 2026Philipp Mondorf, Samuel J. Bell, Jesse Dodge +1LLM EvaluationNeural Network Robustness

  15. Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations

    May 13, 2026Qisong He, Jinwei Hu, Xinmiao Huang +3Belief RevisionLLM Grounding

  16. Negation Neglect: When models fail to learn negations in training

    May 13, 2026Harry Mayne, Lev McKinney, Jan Dubiński +3LLM ReliabilityLLM Safety

  17. Discovery of Hidden Miscalibration Regimes

    May 13, 2026Katarzyna Kobalczyk, Mihaela van der SchaarPost-Hoc CalibrationLanguage Model Calibration

  18. LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

    May 13, 2026Stef van BuurenLLM EvaluationConfidence Estimation in Language Models

  19. LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs

    May 12, 2026Zenghui Zhou, Man Li, Xiaoke Fang +3LLM EvaluationAutomated Software Testing

  20. ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

    May 12, 2026Chen Li, Xiaoling Hu, Songzhu Zheng +2Confidence Estimation in Language ModelsLanguage Model Calibration

  21. SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

    May 12, 2026Xiaoyuan Li, Yuzhe Wang, Moxin Li +6LLM EvaluationBenchmark Construction

  22. Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement

    May 12, 2026Jinyuan Wang, Ningyuan Deng, Yi YangLanguage Model CalibrationLLM Reliability