Factual Consistency Evaluation

Latest papers 52

All topics
CardsList
  1. Do Time-Series QA Systems Read the Time Series? Evidence Use and Reasoning Reliability

    Oct 5, 2026Zhuomin Chen, Jingchao Ni, Xu Zheng +4Time Series ReasoningTime Series QA

  2. Semantic Uncertainty Quantification Needs Factual Equivalence

    Sep 28, 2026Joseph Hoche, Quentin Guimard, Gianni FranchiConfidence Estimation in Language ModelsFactual Consistency Evaluation

  3. MIC: Explaining Image-Claim Inconsistencies in AI-Generated Multimodal Misinformation

    Sep 27, 2026Ruihong Zeng, Jonathan Tonglet, Preslav Nakov +1Factual Consistency EvaluationAutomated Fact-Checking

  4. CHI: A Composite Hallucination Index Unifying Entity, Relation, and Quantity Dimensions for Summarization Evaluation

    Sep 27, 2026Praveenkumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad VittalaHallucination in Language ModelsFactual Consistency Evaluation

  5. Can Jev Judge Radiology Reports? Evaluating a System One Model for Clinical Factuality

    Sep 23, 2026Jiaju Huang, Hao Yang, Xinyu Ma +6Radiology Report GenerationLLM-as-a-Judge

  6. Calibration Is Not Verification: Falsifiability-Aware Conformal Routing for Mixture-of-Agents

    Sep 22, 2026Nada Rahali, Zijia Wang, Zhisong LiuFactual Consistency EvaluationConformal Prediction

  7. Can We Trust the Judges? Validation of Factuality Evaluation Methods via Answer Perturbation

    Sep 14, 2026Sarra Gharsallah, Adele Robaldo, Mariia Tokareva +5LLM EvaluationLLM-as-a-Judge

  8. Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection

    Sep 3, 2026Joe Cecil, Marjorie FreedmanLLM-as-a-JudgeFactual Consistency Evaluation

  9. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4LLM Answer VerificationLanguage Model Generation Evaluation

  10. LOOMSUM:Weaving Quantitative and Narrative Evidence for Faithful Long Text-Table Summarization

    Aug 31, 2026Meng Zhou, Wenhao You, Wei YuanFactual Consistency EvaluationText Summarization

  11. A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

    Aug 8, 2026Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala +1Hallucination in Language ModelsFactual Consistency Evaluation

  12. TriQua: Reconciling Granularity and Context in Factuality Evaluation

    Aug 5, 2026Jin Liu, Steffen Thoma, Achim RettingerLLM Answer VerificationFactual Consistency Evaluation

  13. VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

    Aug 4, 2026Ivan Kartáč, Jan Tovarys, Mateusz Lango +1LLM Answer VerificationFactual Consistency Evaluation

  14. Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text

    Jul 29, 2026Aman Kumar, Lasitha Vidyaratne, Dipanjan D Ghosh +2Factual Consistency Evaluation

  15. Detecting AI-Generated Video: A Vision-Language Dual-View Survey

    Jul 12, 2026Dylan Xinming Hou, Juntian Zhang, Xu Gu +5Factual Consistency EvaluationDeepfake Detection

  16. Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

    Jun 21, 2026Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima +2LLM Answer VerificationLong-Form Document Generation

  17. A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

    Jun 14, 2026Weixiao Zhou, Gengyao Li, Xianfu Cheng +3LLM EvaluationLong-Context Language Model Evaluation

  18. Layer-Resolved Optimal Transport for Hallucination Detection in NMT and Abstractive Summarization

    Jun 11, 2026Mariia Onyshchuk, Maksym-Vasyl Tarnavskyi, Marta SumykTransformer InterpretabilityHallucination Detection