RAG Evaluation

RAG: Retrieval-Augmented Generation

Latest papers 224

All topics
CardsList
  1. RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety

    Sep 11, 2026Adithiyan Rajan Indira Saravanan, Kathleen C. FraserLLM Safety BenchmarksLLM Safety

  2. Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems

    Sep 8, 2026Maximilian Schall, Sedigheh Eslami, Markus Krimmel +4Agentic RetrievalMultilingual IR

  3. Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines

    Sep 4, 2026Siddharth Vohra, Runmin Jiang, Xiaomo Li +1Question AnsweringRAG Evaluation

  4. Enhancing Financial Question Answering: A Novel Benchmark Dataset of Banks' financial statements

    Sep 3, 2026Arianna Miola, Bruno Spaccavento, Lorenzo Silotto +2Financial QARAG Evaluation

  5. SpecMind: Enabling Spectrum Intelligence via Multi-Agent Hybrid Retrieval-Augmented Generation

    Aug 31, 2026Songwei Dong, Bingyan Lu, Makayla Kienlen +2Retrieval-Augmented GenerationWireless Communications

  6. Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation

    Aug 31, 2026Atta Ul Asad, Ahsan Bilal, Muhammad Ali +2KV CachingRAG Evaluation

  7. Towards Expert Financial QA via Self-Improving RAG

    Aug 27, 2026Junjie Xiong, Shawheen Ghezavat, Aum HirparaLLM Self-CorrectionFinancial QA

  8. WARP: Wasserstein-Aligned RAG for Population Opinions

    Aug 24, 2026Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran +1RAG Evaluation

  9. Query Expansion Should Be Coordinated: Dense Expands, Sparse Anchors

    Aug 16, 2026Chunran ZhangRetrieval-Augmented GenerationRAG Evaluation

  10. Who Speaks Matters: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings

    Aug 13, 2026Mirko Tritella, Riccardo Pozzi, Matteo PalmonariRetrieval-Augmented GenerationPolitical Discourse Analysis

  11. Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

    Aug 10, 2026Rose Cymbler, Daniel Guez, Laurent FabreTemporal IRLegal QA

  12. Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence

    Aug 10, 2026Joshua Castillo, Santosh Nukavarapu, Ravi MukkamalaHybrid IRInformation Retrieval

  13. DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

    Aug 8, 2026Anthony Miyaguchi, Conor JohnstonLLM EvaluationLLM-as-a-Judge

  14. Private Anytime Selective-Risk Certification for Federated Retrieval-Augmented Generation: Guarantees and Empirical Limits

    Aug 8, 2026Sanjeda Akter, Ibne Farabi Shihab, Anuj SharmaAnytime-Valid InferenceRAG Evaluation

  15. TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

    Aug 7, 2026Yong-Bin Kang, Anthony McCoskerRetrieval-Augmented GenerationRAG Evaluation

  16. HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards

    Aug 6, 2026Zhuowen Liu, Bohan Cui, YinShang Guo +2Reward HackingLLM Auditing

  17. SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG

    Aug 4, 2026Kaysarul Anas Apurba, Md. Hasibul Hasan, Rofiqul Alam Shehab +1Cross-Encoder RerankingScientific QA

  18. When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification

    Aug 2, 2026Pritam Deka, Prabhjot SinghExplainable Artificial IntelligenceAutomated Fact-Checking

  19. A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability

    Aug 1, 2026Meftun Akarsu, Burak Özdemir, Doğancan Büyükçolak +1LLM-as-a-JudgeGraph Retrieval-Augmented Generation

  20. Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

    Jul 31, 2026Jeonghwan Choi, Taewon Yun, Minjeong Ban +3Reference-Free EvaluationRAG Evaluation