LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. How Much Prompt Is Enough? A Blackbox Minimization of Few-Shots in LLMs

    Sep 28, 2026Ali Alfageeh, Rahul Gopinath, Amin AlipourLLM PromptingFew-Shot Prompting

  2. A Polyphonic Conception of AI Understanding

    Sep 28, 2026Matthieu Queloz, Pierre BeckmannLLM InterpretabilityLLM Reliability

  3. Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation

    Sep 28, 2026Fahrell Giovanny, Geby Bayuningtyas, Sahrul Mukharom +1Knowledge Conflicts in Language ModelsAdversarial Attacks on LLMs

  4. Semantic Uncertainty Quantification Needs Factual Equivalence

    Sep 28, 2026Joseph Hoche, Quentin Guimard, Gianni FranchiConfidence Estimation in Language ModelsFactual Consistency Evaluation

  5. When Words Fall Short: Iterative Synergy Between Verbalized Reasoning and Hidden Features for LLM Confidence Estimation

    Sep 28, 2026Yekun Xu, Ante Wang, Jingyi Ren +3Confidence Estimation in Language ModelsLLM Reliability

  6. Toward a Graded Measure of Belief Stability in Large Language Models

    Sep 28, 2026Samantha Dies, Branden Fitelson, Tina Eliassi-RadLLM ReliabilityLLM Uncertainty Estimation

  7. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Reward ModelingLLM Reliability

  8. Feedback Makes Perfect: A Closed-Loop Framework for NL-to-STL Translation

    Sep 27, 2026Bowen Ye, Xiang YinSignal Temporal LogicLLM Reliability

  9. Beyond Average Safety: Chance-Constrained LLM Fine-tuning

    Sep 24, 2026Taha Entesari, Mahyar FazlyabStochastic OptimizationChance-Constrained Optimization

  10. Exact Feedback Is Not Control: Evaluating Text-based Closed-Loop Revision in LLMs

    Sep 23, 2026Haitong Jiang, Chunlin Liu, Yile Wang +1LLM Self-CorrectionControllable Text Generation

  11. Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference

    Sep 22, 2026Gaoyuan Du, Anam Nawaz Khan, Rex Zhou +4Language Model DecodingLLM Inference

  12. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLLM EvaluationConfidence Estimation in Language Models

  13. On the security and privacy of LLMs in Mobility

    Sep 22, 2026Mauro Conti, Lorenzo Perinello, Umberto SalviatiIntelligent Transportation SystemsLLM Security

  14. LLJ Cards: Best practices for the Use of LLMs as Judges

    Sep 21, 2026Khaoula Chehbouni, Melina Medjdoub, Florian Carichon +2LLM EvaluationLLM-as-a-Judge

  15. ChartJudgeBench: Evaluating LMM Judges for Chart-to-Code Generation

    Sep 21, 2026Lijian Wu, Henry Hengyuan Zhao, Zijian Zhang +3VLM EvaluationLLM Evaluation

  16. EnterpriseVal: Quantifying the Efficacy, Reliability and Value of Generative AI in the Enterprise

    Sep 18, 2026Abbas Raza Ali, Muhammad Ajmal Siddiqui, Moona ZahidHuman-in-the-Loop EvaluationLLM Reliability

  17. Intrinsic Sequence-Likelihood Confidence in Retrieval-Dominated Extractive QA: Two Pre-Specified Negatives, and What They Do and Do Not Attribute

    Sep 17, 2026Gunwoo Lee, Changmin Sung, Sang-Hwan Gwak +3LLM EvaluationSelective Prediction

  18. Reproducibility is not construct validity: LLM measurement of institutionally situated communication

    Sep 17, 2026Veronika Batzdorfer, Carlo Romano Marcello Alessandro SantagiustinaLLM EvaluationLLM-Assisted Annotation

  19. WaveTLM: Reliable Time-Series Language Modeling through Task Compilation

    Sep 16, 2026Jiahui Chen, Bingke Zhu, Hongyu Pan +1LLM ReliabilityTime-Series Foundation Models