RAG Evaluation

RAG: Retrieval-Augmented Generation

Latest papers 224

All topics
CardsList
  1. Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

    Jun 5, 2026Sevgi Yigit-SertRetrieval-Augmented GenerationKnowledge Conflicts in Language Models

  2. Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

    Jun 4, 2026Anuj Maharjan, Devinder Kaur, Richard MolyetRetrieval-Augmented GenerationAdaptive RAG

  3. Answer Presence Drives RAG Rewriting Gains

    Jun 4, 2026Yuejie Li, Yueying Hua, Ke Yang +8Multi-Hop QARAG Security

  4. Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

    Jun 3, 2026Alejandro Lozano, Keiko Ihara, Ping-Hao Yang +13Text SummarizationRAG Evaluation

  5. QO-Bench: Diagnosing Query-Operator-Preserving Retrieval over Typed Event Tuples

    Jun 3, 2026Mengao Zhang, Xiang Yang, Chang Liu +2Information RetrievalRAG Evaluation

  6. MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning

    Jun 3, 2026Qiyang Xie, Jialun Wu, Xinjie He +4Conversational MemoryRetrieval-Augmented Generation

  7. MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

    Jun 2, 2026Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal +7Multimodal RAGMultimodal QA

  8. When Retrieval Doesn't Help: A Large-Scale Study of Biomedical RAG

    Jun 2, 2026Erfan Nourbakhsh, Rocky Slavin, Ke Yang +1Retrieval-Augmented GenerationLLM Grounding

  9. Re-Ranking Through an Attribution Lens for Citation Quality in Legal QA

    Jun 2, 2026Mohamed Hesham Elganayni, Selim SalehCross-Encoder RerankingFeature Attribution

  10. Chunking Methods on Retrieval-Augmented Generation - Effectiveness Evaluation Against Computational Cost and Limitations

    May 30, 2026Mateusz Śmigielski, Michał Rajkowski, Mateusz Zbrocki +5Document ChunkingRetrieval-Augmented Generation

  11. Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory

    May 29, 2026Han Zhang, Zihao Tang, Xin Yu +8LLM EvaluationMemory-Augmented Language Models

  12. On the impact of retrieved content representations in RAG Pipelines

    May 29, 2026Jonathan J Ross, Bevan Koopman, Anton van der Vegt +1Retrieval-Augmented GenerationRAG Evaluation

  13. CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law

    May 28, 2026Ethan Zhao, Maksym Taranukhin, Wei Cui +2Retrieval-Augmented GenerationLegal QA

  14. Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking

    May 28, 2026Songbo Hu, Yinhong Liu, Ej Zhou +5Spoken Dialogue SystemsRAG Evaluation

  15. RAISE: RAG Design as an Architecture Search Problem

    May 28, 2026Zhen Chen, Yibing Liu, Weihao Xie +3RAG EvaluationNeural Architecture Search

  16. K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance

    May 28, 2026Eunbyeol Cho, Yunseung Lee, Mirae Kim +3Retrieval-Augmented GenerationHallucination in Language Models

  17. Verified Misguidance: Measuring Structural Citation Failures in Search-Augmented LLMs

    May 27, 2026Yongsik Seo, Wooseok Jeong, Eunyoung Kim +2Citation VerificationRAG Evaluation

  18. Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

    May 27, 2026Pin Qian, Su Wang, Xiaoyuan Wang +7Factual Consistency EvaluationCitation Verification

  19. A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test

    May 27, 2026Camilo Chacón Sartori, José H. GarcíaRetrieval-Augmented GenerationLLM-as-a-Judge

  20. Separating Semantic Competition from Context Length in RAG Reading

    May 26, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh +4Long-Context RetrievalRetrieval-Augmented Generation