Factual Consistency Evaluation

Latest papers 52

All topics
CardsList
  1. Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

    Jun 4, 2026Jonathan von Rad, Louis Arts, George Burgess +6Multilingual Language Model EvaluationRL for Language Models

  2. RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports

    Jun 3, 2026Zhenhong Yang, Zhuoyun Liu, Jintao Fei +4Factual Consistency EvaluationAutomated Evaluation

  3. Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

    May 27, 2026Pin Qian, Su Wang, Xiaoyuan Wang +7Factual Consistency EvaluationCitation Verification

  4. MATCHA: Matching Text via Contrastive Semantic Alignment

    May 26, 2026Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1LLM EvaluationSemantic Textual Similarity

  5. Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics

    May 26, 2026Yuxuan Ye, Raul Santos-Rodriguez, Edwin SimpsonFactual Consistency EvaluationText Summarization

  6. FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

    May 18, 2026Youngsun Lim, Cusuh Ham, Pin-Yu Chen +1Factual Consistency EvaluationAutomated Evaluation

  7. SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

    May 15, 2026Avijit Shil, Suman SamuiLLM EvaluationFactual Consistency Evaluation

  8. Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction

    May 4, 2026Florian Geissler, Francesco Carella, Laura Fieback +1Retrieval-Augmented GenerationFactual Consistency Evaluation

  9. DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

    Apr 28, 2026Cennet Oguz, Yasser Hamidullah, Josef van Genabith +1Multimodal GroundingVideo Understanding

  10. LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2Language Model Generation EvaluationFactual Consistency Evaluation

  11. CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

    Apr 27, 2026Ruifeng Yuan, Wanxing Chang, Weiwei Cao +4Radiology Report GenerationMedical Report Generation

  12. BioDivergence: A Benchmark and Evaluation Framework for Hidden Contextual Contradictions in Biomedical Abstracts

    Apr 23, 2026Elias Hossain, Sanjeda Sara Jennifer, Sabera Akter Bushra +1Claim VerificationFactual Consistency Evaluation

  13. Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline

    Apr 23, 2026Philip Zhong, Don Wang, Jason ZhangLLM EvaluationFactual Consistency Evaluation

  14. Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

    Apr 21, 2026Eoghan Cunningham, Derek Greene, James Cross +1LLM EvaluationFactual Consistency Evaluation

  15. Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

    Mar 11, 2026Weixin Liu, Congning Ni, Qingyuan Song +4Claim VerificationHealthcare

  16. AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains

    Jan 21, 2026Adam Szelestey, Sofie van Engelen, Tianhao Huang +3Factual Consistency EvaluationLLM Reliability

  17. Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

    Jan 7, 2026Yao Dou, Benjamin Mamut, Wei XuLegal NLPLLM Evaluation

  18. SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

    Apr 10, 2025Sher Badshah, Ali Emami, Hassan SajjadLLM EvaluationLanguage Model Generation Evaluation