RAG Evaluation

RAG: Retrieval-Augmented Generation

Latest papers 224

All topics
CardsList
  1. RAG-Stress: Probing the Limits of Evidence Reliance in Retrieval-Augmented Generation

    Oct 8, 2026Shunyuan Zhou, Hao Chen, Tianyu Wang +3Retrieval-Augmented GenerationRAG Evaluation

  2. TopoGraphRAG-Bench: Evaluating Multimodal GraphRAG on Layout-Grounded Evidence Reasoning

    Oct 7, 2026Ruochi Li, Jianzhe Lin, Haoxuan Zhang +4Graph Retrieval-Augmented GenerationMultimodal RAG

  3. Mapping the RAG Landscape: A Four Axis Taxonomy of Efficiency, Defense, Interactivity, and Reasoning

    Oct 1, 2026Meghana Sunil, Shravya V, Shravan Venkatraman +1Retrieval-Augmented GenerationRAG Security

  4. AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation

    Oct 1, 2026Giulio Zeloni, Enrico Lo Conte, Salvatore Rionero +3LLM-as-a-JudgeRAG Evaluation

  5. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  6. RAGScope: A Leakage-Controlled, Cost-Aware Evidence-Gating Protocol for RAG Hallucination Triage

    Sep 30, 2026Zeming Liu, Qibai Chen, Jingtao Zhang +1Selective PredictionHallucination Detection

  7. Re-ranking and Late Interaction Drive Retrieval Quality: A Controlled Comparison of RAG Strategies for Scientific Question Answering

    Sep 29, 2026Bhagyesh Rathi, Eshan Chawla, William B. AndreopoulosLate Interaction RetrievalScientific QA

  8. BITEM at the NTCIR-19 R2C2 Task: Predicting Confidence from Agentic RAG Pipeline Signals

    Sep 29, 2026Julien Knafou, Luc Mottin, Alexandre Flament +3Retrieval-Augmented GenerationAgentic RAG

  9. Retrieve, Reproduce, Reveal: Dissecting Retrieval-Augmented Software Vulnerability Detection

    Sep 29, 2026Sabrina Kaniewski, Tim Krämer, Julius Bächle +3Software Vulnerability DetectionSoftware Engineering Benchmarks

  10. Return or Revise? Learning When Revision Helps Retrieval-Augmented QA

    Sep 24, 2026Nicholas Kashani Motlagh, Tim Anderson, Jeremy Gwinnup +1Retrieval-Augmented GenerationLLM Answer Verification

  11. Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation

    Sep 24, 2026Tobias Deußer, Abhishek Pillai, Aurelio F. Bariviera +5Retrieval-Augmented GenerationLegal QA

  12. CRISS: A Retrieval-Augmented AI Chatbot for Assisting Cancer Registrars

    Sep 24, 2026Vani Seth, Mohammad Beheshti, Anirudh Kambhampati +4Retrieval-Augmented GenerationHuman-in-the-Loop AI

  13. Evaluating Open-Weight LLMs for Turkish Domain Documents Under Retrieval and Hardware Constraints

    Sep 23, 2026Imtiaz Ul Hassan, Öykü Akbulut, Onur Kaya +4Multilingual Language Model EvaluationLLM Evaluation

  14. Re:CAP - Auditing Retrieval Coverage in Production RAG Pipelines

    Sep 21, 2026Aviral Joshi, Hanoz Bhathena, Max Nelson +1RAG EvaluationIR Evaluation

  15. RAFT: A Stateful Retrieval-Augmented Framework for Troubleshooting Agents

    Sep 17, 2026Mingxuan Zhang, Xiaowen Wang, Anupma Sharan +4Retrieval-Augmented GenerationState Tracking

  16. Version- and Scope-Aware Question Answering over Normative Documents: A Deployed System and an End-to-End Evaluation at Production Scale

    Sep 16, 2026Liuyin Wang, Shuaipeng Jin, Jiwei Shi +1Document QARAG Evaluation

  17. When Is Graph Structure Worth Its Cost? The Case for Structure Pricing in Retrieval-Augmented Generation

    Sep 16, 2026Yuzhong Zhang, Haoyang Ma, Chao Peng +3Retrieval-Augmented GenerationGraph Retrieval-Augmented Generation

  18. AquiLLM: Evaluating Faithfulness in Open-Weight RAG-LLM Systems for Scientific Research

    Sep 15, 2026Bernie Boscoe, Srinath Saikrishnan, Vikram Seenivasan +6AI-Assisted Scientific ResearchOpen-Weight Language Models

  19. CiteGuard-RAG: A Validation-Centered AI System for Evidence-Grounded Question Answering

    Sep 14, 2026Sumit Barua, Guan Hong, Halil Dursunoglu +2Retrieval-Augmented GenerationCitation Verification

  20. Empirical Evaluation of Open-Source Large Language Models for Retrieval-Augmented Generation in ESG Domain

    Sep 14, 2026Motaz Saad, Anna Borrelli, Ivan Gentile +3LLM EvaluationLLM Grounding

  21. WinSyn: An Automated Pipeline for Realistic Enterprise Question-Answering Evaluation

    Sep 14, 2026Amey Varhade, Ananya Sutradhar, Ravishankar Krishnaswamy +1Synthetic Data GenerationAI Agent Evaluation

  22. EAR: Entity-Aware Partitioning Approach for Retrieval-Augmented Generation Development

    Sep 14, 2026Cenab Batu Bora, Oylum Alatl\i, Sebnem Bora +1Document ChunkingRetrieval-Augmented Generation

  23. Debiasing as a Measurement Intervention: Calibrated Ties and Resolution Loss in LLM-as-a-Judge Evaluation

    Sep 14, 2026Liang Zhao, Yong Wang, Jiangzhe ChenLLM-as-a-JudgeLLM Agent Evaluation