RAG Evaluation

RAG: Retrieval-Augmented Generation

Latest papers 224

All topics
CardsList
  1. Assessment of RAG and Fine-Tuning for Industrial Question-Answering-Applications

    May 10, 2026Jakob Sturm, Josef Pichlmeier, Christian Bernhard +4LLM Fine-TuningCost-Aware Inference

  2. Generating Leakage-Free Benchmarks for Robust RAG Evaluation

    May 9, 2026Jiayi Liu, Jiaxing Zhang, Bowen Jin +1Benchmark ContaminationSynthetic Benchmark Generation

  3. The Interference Gap: Comparing Retrieval Bounds in Human Memory and RAG Systems

    May 9, 2026Dongxin Guo, Jikun Wu, Siu-Ming YiuComputational Cognitive ModelingEpisodic Memory

  4. LeakDojo: Decoding the Leakage Threats of RAG Systems

    May 7, 2026Maosen Zhang, Jianshuo Dong, Boting Lu +4Data LeakagePrivacy Leakage in Language Models

  5. DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

    May 6, 2026Bryan Li, William Walden, Yu Hou +6Language Model Generation EvaluationRAG Evaluation

  6. Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction

    May 4, 2026Florian Geissler, Francesco Carella, Laura Fieback +1Retrieval-Augmented GenerationFactual Consistency Evaluation

  7. Seeking Information with RAG-Assistants: Does Model Size Matter in Human-AI Collaborations?

    May 1, 2026Lennard C. Froma, Tom Kouwenhoven, Maaike H. T. de Boer +2LLM EvaluationLanguage Model Scaling

  8. H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations

    May 1, 2026Passant Elchafei, Hossam Emam, Mohamed Alansary +2Retrieval-Augmented GenerationInformation Retrieval

  9. "I Don't Know" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation

    May 1, 2026Daan Di Scala, Maaike de Boer, Pınar YolumRetrieval-Augmented GenerationLLM Reliability

  10. NeocorRAG: Less Irrelevant Information, More Explicit Evidence, and More Effective Recall via Evidence Chains

    Apr 30, 2026Shiyao Peng, Qianhe Zheng, Zhuodi Hao +7Multi-Hop QARetrieval-Augmented Generation

  11. Quantifying Prior Dominance in RAG Systems

    Apr 29, 2026Barak OrLLM GroundingKnowledge Conflicts in Language Models

  12. Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

    Apr 28, 2026Li Ju, Junzhe Wang, Qi ZhangContextual FaithfulnessRetrieval-Augmented Generation

  13. Domain Fine-Tuning vs. Retrieval-Augmented Generation for Medical Multiple-Choice Question Answering: A Controlled Comparison at the 4B-Parameter Scale

    Apr 26, 2026Avi-ad Avraam BuskilaRetrieval-Augmented GenerationHealthcare

  14. FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

    Apr 26, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuLLM Answer VerificationFinancial QA

  15. Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines

    Apr 24, 2026Negar Arabzadeh, Andrew Drozdov, Michael Bendersky +1Retrieval-Augmented GenerationRAG Evaluation

  16. Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

    Apr 24, 2026Zhanli Li, Yixuan Cao, Lvzhou Luo +1Document QARAG Evaluation

  17. MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

    Apr 20, 2026Shaden Alshammari, Kevin Wen, Abrar Zainal +5Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  18. Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

    Apr 20, 2026Lorenz Brehme, Thomas Ströhle, Ruth BreuMulti-Hop QALLM-as-a-Judge

  19. A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents

    Apr 20, 2026Bao Gia Doan, Aditya Joshi, Pantelis Elinas +4Synthetic Benchmark GenerationRAG Evaluation

  20. KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

    Apr 18, 2026Parthaw Goswami, Jaynto Goswami DeepMultimodal RAGVisual Reasoning

  21. Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

    Apr 16, 2026Zhijun Guo, Alvina Lai, Emmanouil Korakas +6Clinical Decision SupportRAG Evaluation