LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

    Jun 29, 2026Yangda Peng, Yunjia Qi, Haotian Xia +8LLM-as-a-JudgeAI Agent Benchmarks

  2. Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback

    Jun 29, 2026Jiamei Jiang, Jiajing Zhang, Feifei Mo +2LLM PlanningLLM Reliability

  3. Reliability-Prioritized Fine-Grained Generation in Multimodal Large

    Jun 28, 2026Xiaomeng Fan, Wei Wu, Yuwei Wu +9Direct Preference OptimizationMultimodal Large Language Models

  4. Diagnosing and Repairing Factual Errors in RAG under Budget Constraints

    Jun 28, 2026Soroush Hashemifar, Havva Alizadeh Noughabi, Fattane Zarrinkalam +1Retrieval-Augmented GenerationLLM Reliability

  5. Travel-Oriented Reasoning Large Language Model via Domain-Specific Knowledge Graphs

    Jun 28, 2026Vignesh Ram Nithin Kappagantula, Shayan Hassantabar, Samuel Simpson +1LLM GroundingLLM Reasoning with Graphs

  6. AB-RAG: Adaptive Budgeted Retrieval-Augmented Generation for Reliable Question Answering

    Jun 27, 2026Ansh KamthanRetrieval-Augmented GenerationLLM Answer Verification

  7. The strength of clinical evidence is recoverable from language model representations but not from their stated grades

    Jun 27, 2026Soroosh Tayebi ArastehLLM InterpretabilityLanguage Model Calibration

  8. When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

    Jun 27, 2026Yong Yi Bay, Kathleen A. YearickLLM EvaluationSelf-Consistency Decoding

  9. Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs

    Jun 26, 2026Manuel PitaLLM EvaluationPsychometric Validation

  10. Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

    Jun 26, 2026Jiajing Zhang, Jiamei Jiang, Chenyang Zhang +3LLM Self-RefinementLLM Planning

  11. When are likely answers right? On Sequence Probability and Correctness in LLMs

    Jun 25, 2026Johannes Zenn, Jonas GeipingLLM EvaluationLanguage Model Decoding

  12. LLM-based Models for Detecting Emerging Topics in Service Feedback

    Jun 25, 2026Mahsa Tavakoli, Ruth Bankey, Cristián BravoHuman-in-the-Loop AILLM Reliability

  13. Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

    Jun 25, 2026Jerome Marston, Tino Kreutzer, Salomé Garnier +3LLM EvaluationHuman-in-the-Loop Annotation

  14. Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

    Jun 24, 2026Yupu Hao, Zhuoran Jin, Huanxuan Liao +2Supervised Fine-TuningLLM Reliability

  15. Cliff Tokens: Analyzing Failure Trigger Tokens in LLM Mathematical Reasoning

    Jun 24, 2026Jaeyong Ko, Jinu Lee, Pilsung Kang +1Numerical Reasoning in Language ModelsLLM Reliability

  16. LLM-Based Scientific Peer Review: Methods, Benchmarks, and Reliability Challenges

    Jun 23, 2026Thi Huyen Nguyen, Zahra AhmadiScholarly Peer ReviewLLM Security

  17. On the Stability of Prompt Ranking in Large Language Model Evaluation

    Jun 23, 2026Shaoshuai Du, Penghao Liang, Yixian Shen +3LLM EvaluationLLM Prompting

  18. Pigeonholing: how bad prompts hurt models, causing collapse and mistakes

    Jun 23, 2026Hyunji Nam, Keertana Chidambaram, Dorottya Demszky +1LLM ReliabilityIn-Context Learning

  19. VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

    Jun 23, 2026Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale +1Formal VerificationStructured Reasoning