RAG Evaluation

RAG: Retrieval-Augmented Generation

Latest papers 224

All topics
CardsList
  1. Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs

    May 26, 2026Zhe Yu, Wenpeng Xing, Chen Ye +4Language Model Safety EvaluationKnowledge Conflicts in Language Models

  2. The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

    May 26, 2026Zhe Yu, Wenpeng Xing, Yunzhao Wei +4Memorization in Language ModelsLLM Interpretability

  3. AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora

    May 25, 2026Xiaoqing Wu, Feifei Li, Haoliang Ming +1Evidence SelectionRAG Evaluation

  4. RAGe: A Retrieval-Augmented Generation Evaluation Framework

    May 23, 2026Larissa Guder, João Pedro de Moura, Arthur Accorsi +5Retrieval-Augmented GenerationRAG Evaluation

  5. A Systematic Evaluation of Retrieval-Augmented Generation and Language Models for Space Operations

    May 23, 2026Ruben Belo, Marta Guimarães, Cláudia SoaresRetrieval-Augmented GenerationInformation Retrieval

  6. Evaluating Commercial AI Chatbots as News Intermediaries

    May 21, 2026Mirac Suzgun, Emily Shen, Federico Bianchi +5LLM EvaluationQuestion Answering

  7. A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

    May 21, 2026Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor +3Retrieval-Augmented GenerationMultilingual QA

  8. When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering

    May 20, 2026Doeun Lee, Muge Zhang, Yi Yu +11LLM GroundingHealthcare

  9. Fine-grained Claim-level RAG Benchmark for Law

    May 20, 2026Souvick Das, Sallam Abualhaija, Domenico BianculliLegal IRLegal QA

  10. MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

    May 20, 2026Junhao Ruan, Abudukeyumu Abudula, Bei Li +8Conversational SearchSynthetic Benchmark Generation

  11. Graph-Augmented Retrieval for Cross-Entity Financial Sentiment Analysis: A Comparative Study

    May 19, 2026Rajan Bastakoti, Sagar Bhetwal, Nirajan Acharya +1Graph Retrieval-Augmented GenerationFinancial Sentiment Analysis

  12. EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design

    May 19, 2026Gioele Molinari, Florian Felten, Soheyl Massoudi +1Multi-Agent LLM SystemsLLM Agent Evaluation

  13. MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

    May 17, 2026Debashish Chakraborty, Dengjia Zhang, Jialiang Jin +7Multimodal RAGRetrieval-Augmented Generation

  14. ConflictRAG: Detecting and Resolving Knowledge Conflicts in Retrieval Augmented Generation

    May 17, 2026Chenyu Wang, Yueyuan Li, Yingmin Liu +1Retrieval-Augmented GenerationKnowledge Conflicts in Language Models

  15. Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG

    May 14, 2026Riccardo Terrenzi, Maximilian von Zastrow, Serkan AyvazData ProvenanceGraph Retrieval-Augmented Generation

  16. Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

    May 14, 2026Assaf Gerner, Netta Madvil, Nadav Barak +11LLM EvaluationRAG Evaluation

  17. When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context

    May 14, 2026Haojun Weng, Qianqian Yang, Hao Fu +2Retrieval-Augmented GenerationRetrieval Robustness

  18. Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict

    May 14, 2026Yihang Chen, Pin Qian, Su Wang +4Retrieval-Augmented GenerationKnowledge Conflicts in Language Models

  19. When Evidence Conflicts: Uncertainty and Order Effects in Retrieval-Augmented Biomedical Question Answering

    May 13, 2026Yikun Han, Mengfei Lan, Halil KilicogluSelective PredictionHealthcare

  20. Overview of the MedHopQA track at BioCreative IX: track description, participation and evaluation of systems for multi-hop medical question answering

    May 12, 2026Rezarta Islamaj, Joey Chan, Robert Leaman +13Multi-Hop QAHealthcare

  21. ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

    May 11, 2026Alex StinardHealthcareClinical QA

  22. ASTRA-QA: A Benchmark for Abstract Question Answering over Documents

    May 11, 2026Shu Wang, Shansong Zhou, Xinyang Wang +3Question AnsweringDocument QA

  23. Trust or Abstain? A Self-Aware RAG Approach

    May 11, 2026Xi Zhu, Ziqi Wang, Kai Mei +5Retrieval-Augmented GenerationKnowledge Conflicts in Language Models