Factual Consistency Evaluation

Latest papers 52

All topics
CardsList
  1. Do Time-Series QA Systems Read the Time Series? Evidence Use and Reasoning Reliability

    Oct 5, 2026Zhuomin Chen, Jingchao Ni, Xu Zheng +4Time Series ReasoningTime Series QA

  2. Semantic Uncertainty Quantification Needs Factual Equivalence

    Sep 28, 2026Joseph Hoche, Quentin Guimard, Gianni FranchiConfidence Estimation in Language ModelsFactual Consistency Evaluation

  3. MIC: Explaining Image-Claim Inconsistencies in AI-Generated Multimodal Misinformation

    Sep 27, 2026Ruihong Zeng, Jonathan Tonglet, Preslav Nakov +1Factual Consistency EvaluationAutomated Fact-Checking

  4. CHI: A Composite Hallucination Index Unifying Entity, Relation, and Quantity Dimensions for Summarization Evaluation

    Sep 27, 2026Praveenkumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad VittalaHallucination in Language ModelsFactual Consistency Evaluation

  5. Can Jev Judge Radiology Reports? Evaluating a System One Model for Clinical Factuality

    Sep 23, 2026Jiaju Huang, Hao Yang, Xinyu Ma +6Radiology Report GenerationLLM-as-a-Judge

  6. Calibration Is Not Verification: Falsifiability-Aware Conformal Routing for Mixture-of-Agents

    Sep 22, 2026Nada Rahali, Zijia Wang, Zhisong LiuFactual Consistency EvaluationConformal Prediction

  7. Can We Trust the Judges? Validation of Factuality Evaluation Methods via Answer Perturbation

    Sep 14, 2026Sarra Gharsallah, Adele Robaldo, Mariia Tokareva +5LLM EvaluationLLM-as-a-Judge

  8. Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection

    Sep 3, 2026Joe Cecil, Marjorie FreedmanLLM-as-a-JudgeFactual Consistency Evaluation

  9. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4LLM Answer VerificationLanguage Model Generation Evaluation

  10. LOOMSUM:Weaving Quantitative and Narrative Evidence for Faithful Long Text-Table Summarization

    Aug 31, 2026Meng Zhou, Wenhao You, Wei YuanFactual Consistency EvaluationText Summarization

  11. A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

    Aug 8, 2026Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala +1Hallucination in Language ModelsFactual Consistency Evaluation

  12. TriQua: Reconciling Granularity and Context in Factuality Evaluation

    Aug 5, 2026Jin Liu, Steffen Thoma, Achim RettingerLLM Answer VerificationFactual Consistency Evaluation

  13. VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

    Aug 4, 2026Ivan Kartáč, Jan Tovarys, Mateusz Lango +1LLM Answer VerificationFactual Consistency Evaluation

  14. Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text

    Jul 29, 2026Aman Kumar, Lasitha Vidyaratne, Dipanjan D Ghosh +2Factual Consistency Evaluation

  15. Detecting AI-Generated Video: A Vision-Language Dual-View Survey

    Jul 12, 2026Dylan Xinming Hou, Juntian Zhang, Xu Gu +5Factual Consistency EvaluationDeepfake Detection

  16. Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

    Jun 21, 2026Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima +2LLM Answer VerificationLong-Form Document Generation

  17. A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

    Jun 14, 2026Weixiao Zhou, Gengyao Li, Xianfu Cheng +3LLM EvaluationLong-Context Language Model Evaluation

  18. Layer-Resolved Optimal Transport for Hallucination Detection in NMT and Abstractive Summarization

    Jun 11, 2026Mariia Onyshchuk, Maksym-Vasyl Tarnavskyi, Marta SumykTransformer InterpretabilityHallucination Detection

  19. Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

    Jun 4, 2026Jonathan von Rad, Louis Arts, George Burgess +6Multilingual Language Model EvaluationRL for Language Models

  20. RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports

    Jun 3, 2026Zhenhong Yang, Zhuoyun Liu, Jintao Fei +4Factual Consistency EvaluationAutomated Evaluation

  21. Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

    May 27, 2026Pin Qian, Su Wang, Xiaoyuan Wang +7Factual Consistency EvaluationCitation Verification

  22. MATCHA: Matching Text via Contrastive Semantic Alignment

    May 26, 2026Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1LLM EvaluationSemantic Textual Similarity

  23. Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics

    May 26, 2026Yuxuan Ye, Raul Santos-Rodriguez, Edwin SimpsonFactual Consistency EvaluationText Summarization

  24. FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

    May 18, 2026Youngsun Lim, Cusuh Ham, Pin-Yu Chen +1Factual Consistency EvaluationAutomated Evaluation

  25. SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

    May 15, 2026Avijit Shil, Suman SamuiLLM EvaluationFactual Consistency Evaluation

  26. Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction

    May 4, 2026Florian Geissler, Francesco Carella, Laura Fieback +1Retrieval-Augmented GenerationFactual Consistency Evaluation

  27. DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

    Apr 28, 2026Cennet Oguz, Yasser Hamidullah, Josef van Genabith +1Multimodal GroundingVideo Understanding

  28. LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2Language Model Generation EvaluationFactual Consistency Evaluation

  29. CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

    Apr 27, 2026Ruifeng Yuan, Wanxing Chang, Weiwei Cao +4Radiology Report GenerationMedical Report Generation

  30. BioDivergence: A Benchmark and Evaluation Framework for Hidden Contextual Contradictions in Biomedical Abstracts

    Apr 23, 2026Elias Hossain, Sanjeda Sara Jennifer, Sabera Akter Bushra +1Claim VerificationFactual Consistency Evaluation

  31. Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline

    Apr 23, 2026Philip Zhong, Don Wang, Jason ZhangLLM EvaluationFactual Consistency Evaluation

  32. Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

    Apr 21, 2026Eoghan Cunningham, Derek Greene, James Cross +1LLM EvaluationFactual Consistency Evaluation

  33. Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

    Mar 11, 2026Weixin Liu, Congning Ni, Qingyuan Song +4Claim VerificationHealthcare

  34. AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains

    Jan 21, 2026Adam Szelestey, Sofie van Engelen, Tianhao Huang +3Factual Consistency EvaluationLLM Reliability

  35. Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

    Jan 7, 2026Yao Dou, Benjamin Mamut, Wei XuLegal NLPLLM Evaluation

  36. SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

    Apr 10, 2025Sher Badshah, Ali Emami, Hassan SajjadLLM EvaluationLanguage Model Generation Evaluation