Hallucination in Language Models

Latest papers 187

All topics
CardsList
  1. PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

    Oct 7, 2026Linghao Meng, Feng He, Xuan Yang +5Hallucination in Language ModelsLLM Hallucination Mitigation

  2. Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

    Oct 6, 2026Zizhuo Zhang, Xiong Peng, Jingwei Sun +3Contextual FaithfulnessLLM Evaluation

  3. Hallucination Across the Reasoning Lifecycle: Interface Visibility, Causal Evidence, and Release Control in Large Reasoning Models

    Oct 4, 2026Zhe Yu, Mohan Li, Lei Yu +6LLM Hallucination MitigationHallucination in Language Models

  4. Consensus and Factual Dynamics in Large Populations of Interacting Language Models

    Sep 30, 2026Emanuele Ricco, Elia Onofri, Vincenzo Sammartino +1Hallucination in Language ModelsMulti-Agent Consensus

  5. Faithful Activation Verbalization: Reducing Hallucinations in LLM Representation Interpretation

    Sep 27, 2026Haiyan Zhao, Zirui Hei, Wei Shi +3LLM Hallucination MitigationLLM Interpretability

  6. CHI: A Composite Hallucination Index Unifying Entity, Relation, and Quantity Dimensions for Summarization Evaluation

    Sep 27, 2026Praveenkumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad VittalaHallucination in Language ModelsFactual Consistency Evaluation

  7. The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining

    Sep 26, 2026Vy Nguyen, Ziqi Xu, Jeffrey Chan +5Hallucination in Language ModelsCircuits in Language Models

  8. Hallucination Neurons and Where to Find Them: An Investigation into the existence of Hallucination Neurons

    Sep 24, 2026Huseyin Cavus, Sebin Sabu, Joshua Spear +2LLM InterpretabilityHallucination in Language Models

  9. The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination

    Sep 14, 2026Xi Wang, Shijia Xu, Rongfeng GuoMemorization in Language ModelsHallucination in Language Models

  10. Biomedical Reference Generation Remains Unreliable across 26 Large Language Models

    Sep 14, 2026Maxim Topaz, Zhihong Zhang, Nir Roguin +3LLM EvaluationHallucination in Language Models

  11. LexAgentHallu: A Hierarchical Benchmark for Profiling Hallucinations in Legal Agents

    Sep 9, 2026Yujin Zhou, Mingxuan Zheng, Chuxue Cao +4Hallucination in Language ModelsLLM Agent Evaluation

  12. When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models

    Sep 7, 2026Xiaodong Li, Peiwei LiuNumerical Reasoning in Language ModelsHallucination in Language Models

  13. Better Understanding, Better Fixes? A Study of Hallucination in LLM-based Automated Program Repair

    Sep 4, 2026Xuemeng Cai, Jiakun Liu, Linhan Yang +2Automated Program RepairHallucination in Language Models

  14. CHARM: Character Hallucination for Multicultural Role Play Benchmark

    Sep 1, 2026Sunkyung Han, Nahyeon Park, Gaeun Seo +2LLM EvaluationLarge Language Model-Based Role-Play Simulation

  15. The Privacy-Hallucination Tradeoff in Differentially Private Language Models

    Aug 31, 2026Krithika Ramesh, Krishna Pillutla, Danish Pruthi +1Privacy-Preserving Language ModelsHallucination in Language Models

  16. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

    Aug 10, 2026Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam +1Hallucination in Language ModelsLLM Uncertainty Estimation

  17. A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

    Aug 8, 2026Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala +1Hallucination in Language ModelsFactual Consistency Evaluation

  18. Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

    Aug 4, 2026Atri Vivek Sharma, Brian Formento, Alessio LomuscioRetrieval-Augmented GenerationAdversarial Attacks

  19. Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

    Aug 4, 2026S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh +1LLM EvaluationTool-Use Evaluation

  20. HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification

    Aug 4, 2026Salah Eddine Bekhouche, Abdessalam Bouchekif, Hichem Telli +2Hallucination DetectionHallucination in Language Models

  21. Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

    Aug 1, 2026Xinshun Feng, Ziqi Miao, Lijun Li +1AI Agents for Scientific DiscoveryHallucination in Language Models

  22. D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

    Jul 27, 2026Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli +1Language Model Error DetectionHallucination in Language Models

  23. Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory

    Jul 27, 2026Saurabh Ranjan, Konstantina Sokratous, Brian OdegaardHallucination in Language ModelsLanguage Model Self-Assessment

  24. Hallucination Rates in Language Generation

    Jul 25, 2026Debmalya Panigrahi, Fan Wei, Ian ZhangHallucination in Language ModelsText Generation

  25. Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

    Jul 23, 2026Mingyu Wang, Weilin Jin, Wenbo Li +33D Spatial ReasoningHallucination in Language Models

  26. Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

    Jul 23, 2026Jiatong Li, Yuxuan Ren, Weida Wang +2CoT FaithfulnessScientific Reasoning

  27. HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

    Jul 22, 2026Abdessalam Bouchekif, Mohammed-En-Nadhir Zighem, Salah Eddine Bekhouche +9Arabic NLPLLM Answer Verification

  28. Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

    Jul 15, 2026Eunna Lee, Jungpyo Nam, Sunjun HwangLanguage Model Safety EvaluationHallucination in Language Models

  29. Hallucination Detection in Large Language Models Using Diversion Decoding

    Jul 11, 2026Basel Abdeen, S M Tahmid Siddiqui, Meah Tahmeed Ahmed +4Hallucination in Language ModelsLLM Hallucination Detection

  30. Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization

    Jul 7, 2026Kaishen Wang, Tong Zheng, Xuehao Cui +3LLM Hallucination MitigationRL for Language Model Reasoning

  31. Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

    Jul 6, 2026Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios ParaskevopoulosHallucination in Language ModelsRepresentation Geometry in Language Models

  32. Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences

    Jul 1, 2026Mark Russinovich, Ram Shankar Siva Kumar, Ahmed SalemHallucination in Language ModelsCitation Verification

  33. AURORA: Asymmetry and Update-Induced Rotation for Robust Hallucination Detection in Large Language Models

    Jun 28, 2026Zishuai Zhang, Hainan Zhang, Zhiming ZhengHallucination in Language ModelsLLM Hallucination Detection

  34. Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

    Jun 26, 2026Xinyuan Song, Zekun CaiWorld ModelsWorld Model-Based Planning

  35. From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

    Jun 26, 2026Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen +3Uncertainty QuantificationHallucination in Language Models

  36. Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

    Jun 21, 2026Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima +2LLM Answer VerificationLong-Form Document Generation

  37. Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

    Jun 19, 2026Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova +3LLM EvaluationLLM Fine-Tuning

  38. When AI Says "I have been in similar situations": Synthetic Lived Experience in Peer-Like Caregiver Support

    Jun 16, 2026Drishti Goel, Agam Goyal, Veda Duddu +6Emotional Support ConversationHealthcare

  39. Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

    Jun 12, 2026Arnesh Banerjee, Ayushi BhattacharjeeMathematical Reasoning BenchmarksLLM Auditing

  40. PhantomBench: Benchmarking the Non-existential Threat of Language Models

    Jun 9, 2026Haeji Jung, Hila GonenLLM EvaluationHallucination in Language Models

  41. Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models

    Jun 7, 2026Lucrezia Laraspata, Giovanna Castellano, Gennaro VessioKnowledge Conflicts in Language ModelsLLM Interpretability

  42. What's in a Name? Morphological Shortcuts by LLMs in Pharmacology

    Jun 4, 2026Kaijie Mo, Thomas Yang, Chantal Shaib +6Hallucination in Language ModelsLanguage Modeling

  43. Conformal Language Modeling via Posterior Sampling

    Jun 2, 2026Nicolas Emmenegger, Theo X. Olausson, Armando Solar-Lezama +1Hallucination in Language ModelsConformal Prediction

  44. Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization

    Jun 2, 2026Mingkuan Zhao, Wentao Hu, Tianchen Huang +6LLM Hallucination MitigationHallucination in Language Models

  45. The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

    Jun 1, 2026Michał Brzozowski, Neo Christopher ChungLLM AuditingHallucination in Language Models