LLM Reliability

LLM: Large Language Model

Momentum

78 papers in the last four weeks, up 105% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 507

All topics
CardsList
  1. ReLTEx: Reliable LLM-based Taxonomy Expansion

    Aug 11, 2026Zeinab Ghamlouch, Mehwish AlamLLM Hallucination MitigationLLM Reliability

  2. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamPrompt SensitivityLLM Evaluation

  3. Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

    Aug 10, 2026Yanlin YuLLM ReliabilityMachine Translation

  4. Theory-Guided Deception Detection: A RAG-Based Artificial Intelligence Exploration

    Aug 9, 2026David M. Markowitz, Timothy R. LevineRetrieval-Augmented GenerationDeception in Language Models

  5. Can Open-Weight Models Compete on Financial Text Comprehension?

    Aug 9, 2026Jan SpörerLLM EvaluationFinancial QA

  6. On the Robustness of LLMs' Internal Representation of Code Correctness

    Aug 8, 2026Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez +2LLM ReliabilityLanguage Model Robustness

  7. REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

    Aug 8, 2026Zhengze Huang, Luyang Yu, Di Hong +5LLM Hallucination MitigationLLM Reliability

  8. When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

    Aug 7, 2026Yiyao Zhang, Diksha Goel, Hussain Ahmad +2LLM-as-a-JudgeLLM Reliability

  9. Learning When to Trust via Selective Context Preference Optimization

    Aug 6, 2026Xian Sun, Wei Chow, Yingshuo Wang +4Knowledge Conflicts in Language ModelsLLM Reliability

  10. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

    Aug 6, 2026Ro Encarnación, Tina Behzad, Emma Lurie +1LLM Safety BenchmarksLLM Evaluation

  11. Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

    Aug 6, 2026Hamed Damirchi, Ignacio Meza De la Jara, Damith Ranasinghe +2Language Model Error DetectionLLM Interpretability

  12. SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications

    Aug 5, 2026Yixuan Wang, Licheng Luo, Yu Fu +3Selective PredictionLLM Reliability

  13. PPDL: LLM-Based Flows as Probabilistic Programs

    Aug 5, 2026Louis Mandel, Guillaume Baudart, Mandana Vaziri +1LLM InferenceLLM Reliability

  14. The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

    Aug 4, 2026Shashwat Sourav, Aishwarya BalwaniLLM ReliabilityReasoning Trace Analysis

  15. ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

    Aug 4, 2026Shufan Ming, Yikun Han, Gibong Hong +2Relation ExtractionLLM Grounding

  16. Chat Debugging: An Exploratory Study of Human-AI Collaboration to Debug Analog Circuits

    Aug 3, 2026John Hu, Andrew AshLLM ReliabilityHuman-AI Collaboration

  17. How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

    Aug 3, 2026Andres Algaba, Francesca Carlon, Lynn Delcon +3LLM EvaluationLLM Interpretability

  18. EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

    Aug 3, 2026Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne +4Logic ProgrammingSoftware Vulnerability Detection

  19. RH-RAG: Trustworthy Long-Form Generation for Privacy-Constrained Settings

    Aug 2, 2026Raj Shekhar SinghRetrieval-Augmented GenerationLong-Form Document Generation

  20. SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

    Aug 2, 2026Shrenil Shaun Sharma, Avi SharmaCombinatorial OptimizationLLM Reliability

  21. Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks

    Aug 1, 2026Faizan Faisal, Prem Devanbu, Toufique AhmedReasoning DistillationLLM Prompting

  22. SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

    Aug 1, 2026Dahai Yu, Lin Jiang, Rongchao Xu +1Uncertainty QuantificationLLM Reliability