Multimodal QA

QA: Question Answering

Momentum

11 papers in the last four weeks, up 22% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 131

All topics
CardsList
  1. TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

    Jul 21, 2026Zhong Ji, Keqi Jin, Yan Zhang +1Multimodal RAGRetrieval-Augmented Generation

  2. Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists

    Jul 20, 2026Arnavi Chheda-Kothary, Lucy Lu Wang, Joseph Chee Chang +1Multimodal Large Language ModelsScientific QA

  3. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  4. Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

    Jul 16, 2026Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu +6Visual Question AnsweringVisual Spatial Reasoning

  5. EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

    Jul 14, 2026Jiashi Lin, Changhong Jiang, Xiangru Lin +12Multimodal RAGGraph Retrieval-Augmented Generation

  6. LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

    Jul 14, 2026Michael Solodko, Steven Gong, Guangwei Yu +3Multimodal QAAgentic Retrieval

  7. Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

    Jul 12, 2026Saadeldine Eletter, Owais Aijaz, Preslav NakovMultimodal RAGRetrieval-Augmented Generation

  8. UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

    Jul 12, 2026Xiyu Wei, Qingwei Zong, Zhuocheng Yu +1Multimodal QAAI Agent Benchmarks

  9. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual UnderstandingMultimodal Pretraining

  10. What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

    Jul 11, 2026Guanhua Ye, Niu Jingbin, Yan Li +4VLM EvaluationVisual Question Answering

  11. Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

    Jul 10, 2026Nirjhar Das, Md. Al-Mamun ProvathQuestion AnsweringMultimodal QA

  12. Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

    Jul 6, 2026Amol Harsh, Zongyan Han, Jean Lahoud +53D Spatial ReasoningMultimodal QA

  13. Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

    Jul 5, 2026Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu +2Efficient VLM InferenceMultimodal QA

  14. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekMultimodal QACross-Modal Attention

  15. Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

    Jul 3, 2026Xue Li, Yiming GaiMultimodal RAGEfficient Multimodal Inference

  16. EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

    Jul 2, 2026Gianmarco Spinaci, Lukas Klic, Giovanni ColavizzaEducational AssessmentMultimodal QA

  17. MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

    Jul 1, 2026Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi +7Multimodal QADocument QA

  18. Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach

    Jul 1, 2026Md Abu Hanif Shaikh, Abdullah Al ShafiMultimodal RAGMultimodal QA

  19. TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

    Jun 29, 2026Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA

  20. Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

    Jun 28, 2026Bohan Yao, Shruthan Radhakrishna, Vikas YadavMultimodal RAGMultimodal QA

  21. CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

    Jun 25, 2026Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed +3Radiology Report Generation3D Medical Imaging

  22. FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

    Jun 25, 2026Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi +1VLM EvaluationVisual Question Answering

  23. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  24. Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

    Jun 22, 2026Qian Ma, Qiong Wu, Zhengyi Zhou +1Multimodal RAGVisual Question Answering

  25. Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

    Jun 21, 2026Xiangyuan Xue, Yang Yu, Yan Gao +5Efficient Multimodal InferenceMultimodal QA

  26. EvidenceLens: A Claim-Evidence Matrix for Auditing Financial Question Answering

    Jun 19, 2026Fengchen Gu, Xiaotian Ren, Zhengyong Jiang +6Data VisualizationLLM Answer Verification

  27. CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

    Jun 18, 2026Yifan Shen, Pei Tian, Xinzhuo Li +8RL for Language Model ReasoningMixture-of-Experts Inference

  28. Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

    Jun 18, 2026Yuetian Du, Yucheng Wang, Ming Kong +4Multimodal QALanguage Model Calibration