RAG Evaluation

RAG: Retrieval-Augmented Generation

Latest papers 224

All topics
CardsList
  1. BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

    Jul 29, 2026Pengyu Wang, Benfeng Xu, Shaohan Wang +5Retrieval-Augmented GenerationGraph Retrieval-Augmented Generation

  2. A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility

    Jul 27, 2026Rajat Sainju, Dariusz Jarosz, Hairong Shang +5Graph Retrieval-Augmented GenerationScientific QA

  3. Evaluating RAG for French immigration law: a benchmark and baseline study

    Jul 27, 2026Annia Abtout, Julien Delaunay, Monika Ewa RakoczyLLM GroundingLegal IR

  4. Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System

    Jul 27, 2026Phuong Le Huy, Nam H. Nguyen, Quan V. DangRetrieval-Augmented GenerationRAG Evaluation

  5. When Should Active RAG Retrieve? A Budget-Aware Evaluation of Utility, Calibration, and Cost

    Jul 27, 2026Pin Qian, Su Wang, Chong Peng +5Cost-Aware InferenceAgentic RAG

  6. RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models

    Jul 26, 2026Ange Maiztegi, Jon Ayerdi, Miren Illarramendi +1RAG EvaluationAutomated Test Generation

  7. GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning

    Jul 22, 2026Zhaoqi Wang, Zijian Zhang, Xiaomei Yuan +4RAG Poisoning AttacksAutomated Fact-Checking

  8. AILQA: Evaluating AI-Driven Legal Question Answering Systems for the Indian Legal System

    Jul 21, 2026Shubham Kumar Nigam, Shubham Kumar Mishra, Noel Shallum +2Retrieval-Augmented GenerationLegal NLP

  9. MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation

    Jul 20, 2026Hyewon Lee, Minkyung Song, Junghyun Oh +2Retrieval-Augmented GenerationLLM Hallucination Mitigation

  10. Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration

    Jul 18, 2026Maksim Sheverev, David Finkelstein, Sergey NikolenkoLLM Agent MemoryAI Agent Benchmarks

  11. DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

    Jul 15, 2026Brandon Michaels, Brendon JohnsonRetrieval-Augmented GenerationCitation Verification

  12. LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

    Jul 14, 2026Michael Solodko, Steven Gong, Guangwei Yu +3Multimodal QAAgentic Retrieval

  13. RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

    Jul 13, 2026Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka +5KG ConstructionLLM Reasoning with Graphs

  14. CAFE: A Compound-AI Factorial Evaluation Framework

    Jul 11, 2026Fabian Lukassen, Christoph Weisser, Thomas Kneib +1RAG EvaluationAutomated Evaluation

  15. Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off

    Jul 6, 2026Hafsteinn Einarsson, Hafsteinn Birgir Einarsson, Jón Gunnar Ólafsson +1LLM AuditingRAG Evaluation

  16. MIRAGE: Defending Long-Form RAG Against Misinformation Pollution

    Jul 6, 2026Saadeldine Eletter, Ruihong Zeng, Yuxia Wang +3RAG Poisoning AttacksRetrieval Robustness

  17. Candidate-Constrained Retrieval-Augmented Generation for LongEval-RAG: System Design and Empirical Analysis

    Jul 4, 2026Yingdong Yang, Haijian WuRetrieval-Augmented GenerationRAG Evaluation

  18. A Failure-Mode Benchmark for Polymorphic Sybil Poisoning in RAG

    Jul 4, 2026Donghyun Lee, Juntae KimRAG Poisoning AttacksRAG Security

  19. TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation

    Jul 3, 2026Axel TahmasebiMoradi, Lucas Schott, Martin RoyerKG ConstructionRAG Evaluation