Multimodal RAG

RAG: Retrieval-Augmented Generation

Latest papers 100

All topics
CardsList
  1. MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

    May 17, 2026Debashish Chakraborty, Dengjia Zhang, Jialiang Jin +7Multimodal RAGRetrieval-Augmented Generation

  2. Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition

    May 16, 2026Zeheng Wang, Bo Zhao, Yijie Zhu +6Multimodal RAGHierarchical Classification

  3. Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

    May 14, 2026Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim +1Multimodal RAGHealthcare

  4. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  5. Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation

    May 13, 2026Weiqing Luo, Zongye Hu, Xiao Wang +3Multimodal RAGEvidence Selection

  6. ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

    May 13, 2026Zhuofan Shi, Peilun Jia, Baoqin Sun +4Multimodal RAGMultimodal Grounding

  7. Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

    May 12, 2026Ahmad Al-Kabbany, Esraa KassemMultimodal RAGSynthetic Benchmark Generation

  8. Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

    May 11, 2026Peiru Yang, Haoran Zheng, Tong Ju +6Multimodal RAGAdversarial Attacks on VLMs

  9. MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

    May 11, 2026Manyu Li, Ruian He, Chenxi Ma +2Multimodal RAGVisual Question Answering

  10. From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG

    May 8, 2026Jiaju Han, Chao Li, Chengyin Hu +8Multimodal RAGRetrieval-Augmented Generation

  11. Retina-RAG: Retrieval-Augmented Vision-Language Modeling for Joint Retinal Diagnosis and Clinical Report Generation

    May 7, 2026Abdelrahman Zaian, Sheethal Bhat, Mohamed Abdalkader +1Multimodal RAGMedical Report Generation

  12. The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

    May 7, 2026Hoin Jung, Xiaoqian WangMultimodal RAGMultimodal Grounding

  13. Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

    May 5, 2026Quanxing Xu, Ling Zhou, Xian Zhong +3Multimodal RAGVisual Question Answering

  14. From Experimental Limits to Physical Insight: A Retrieval-Augmented Multi-Agent Framework for Interpreting Searches Beyond the Standard Model

    May 4, 2026Altan Cakir, Ayca YerlikayaMultimodal RAGMulti-Agent LLM Systems

  15. FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

    May 2, 2026Zebin Guo, Weidong Geng, Ruichen MaoMultimodal RAGTable QA

  16. Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

    Apr 30, 2026Xupeng Chen, Binbin Shi, Chenqian Le +5Multimodal RAGRetrieval-Augmented Generation

  17. GeoSearch: Augmenting Worldwide Geolocalization with Web-Scale Reverse Image Search and Image Matching

    Apr 28, 2026Tung-Duong Le-Duc, Hoang-Quoc Nguyen-Son, Minh-Son DaoMultimodal RAGImage Matching

  18. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  19. Retrieval-Guided Generation for Safer Histopathology Image Captioning

    Apr 27, 2026Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly +6Multimodal RAGComputational Pathology

  20. MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

    Apr 27, 2026Xihang Wang, Zihan Wang, Chengkai Huang +2Multimodal RAGMultimodal IR

  21. Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation

    Apr 26, 2026Zehua Cheng, Wei Dai, Jiahao SunMultimodal RAGPrivacy-Preserving ML

  22. KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

    Apr 23, 2026Linkai Liu, Wei Feng, Xi Zhao +9Multimodal RAGText-to-Video Generation

  23. A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

    Apr 21, 2026Shuai Wang, Hongyi Zhu, Jia-Hong Huang +6Multimodal RAGMultimodal Grounding

  24. AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

    Apr 20, 2026Junxiao Xue, Quan Deng, Tingqi Hu +4Multimodal RAGVisual Question Answering

  25. KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

    Apr 18, 2026Parthaw Goswami, Jaynto Goswami DeepMultimodal RAGVisual Reasoning

  26. LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

    Apr 18, 2026Yifan Zhu, Yu Mi, Yue Lu +2Multimodal RAGLate Interaction Retrieval

  27. M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models

    Apr 17, 2026Joongmin Shin, Jeongbae Park, Jaehyung Seo +1Multimodal RAGDocument Chunking

  28. RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

    Apr 8, 2026Hui Li, Peien Ding, Jun Li +5Multimodal RAGFake News Detection

  29. MG2^2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

    Apr 4, 2026Sijun Dai, Qiang Huang, Xiaoxing You +1Cross-Modal LearningMultimodal RAG