Multimodal QA

QA: Question Answering

Momentum

11 papers in the last four weeks, up 22% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 131

All topics
CardsList
  1. ReCast: Contract-Preserving Protection for Fixed-Interface Multimodal Reasoning

    Oct 1, 2026Bingchen Pei, Lichong Chen, Bingxi Zhao +8Multimodal QAMultimodal Reasoning

  2. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  3. WeaveData: A Multimodal Data Analysis System with Self-Critiquing and Self-Evolving LLM Plans

    Sep 28, 2026Min Jia, Shihao Zhou, Jun-Peng Zhu +9LLM Self-RefinementLLM Planning

  4. Spatial Action Review: A Visual Analytics Dashboard for Auditing Language-to-Action Hand-offs in Electron Microscopy

    Sep 21, 2026Samia Mohinta, Albert CardonaHuman-in-the-Loop EvaluationMultimodal QA

  5. A2^2Safe: Counterfactual Evidence-Aligned Adaptive Agent Collaboration for Safe and Effective Visual Question Answering

    Sep 21, 2026Quanxing Xu, Ling Zhou, Xian Zhong +4Visual Question AnsweringLLM Safety Alignment

  6. PRISM-RAG: Multimodal Hypergraph Retrieval-Augmented Generation for Tobacco Product and Legislative Policy Reasoning

    Sep 20, 2026Manuel Serna-Aguilera, Raegan Anderes, Page Dobbs +1Multimodal RAGLegal IR

  7. Less Is More: Graph-free Multimodal RAG via Multi-signal Late Fusion

    Sep 16, 2026Tithi Rakshit, Hongkuan Zhou, Lavdim Halilaj +1Multimodal RAGMultimodal IR

  8. Evolution of Multimodal Question Answering: From Modality-Adaptive Extraction to Unified Language Representation

    Sep 8, 2026Abdullah Al ShafiUnified Multimodal ModelsMultimodal QA

  9. Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment

    Sep 8, 2026Zhan-Lun Chang, Dong-Jun Han, Seyyedali Hosseinalipour +2Multimodal RAGMultimodal Reranking

  10. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Tool Use in VLMsMultimodal QA

  11. ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

    Aug 31, 2026Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti +11Hallucination DetectionT2I Generation

  12. Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

    Aug 31, 2026Jaehee Kim, Ji Hoon Chung, Seoyoon Park +5Multimodal QAMultilingual VLM Evaluation

  13. ManGo: Manga Active Narrative Grounding Optimization

    Aug 30, 2026Hao Qiu, Junyan Wang, Zheyuan Liu +4Visual Question AnsweringRL for Language Model Reasoning

  14. CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

    Aug 13, 2026Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud +2LLM Answer VerificationLLM Hallucination Mitigation

  15. HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation

    Aug 13, 2026Yunhao Bai, Zhongwei Qiu, Guangyu Guo +5Medical Report GenerationWorld Model Learning

  16. Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

    Aug 12, 2026Weihao Bo, Shan Zhang, Yanpeng Sun +7Code GenerationMultimodal QA

  17. Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

    Aug 12, 2026Haoyu Zhang, Shuoxun Zhang, Peng Ye +5Visual Question AnsweringMulti-Agent LLM Systems

  18. When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

    Aug 5, 2026Yongxin Wang, Ruizhe Zhou, Yueling Tang +4Multimodal QAMultimodal Reasoning

  19. LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

    Aug 2, 2026Ziyan Xiao, Yinghao Zhu, Wenting Zhang +2Data VisualizationVisual Reasoning

  20. PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

    Aug 2, 2026Jingyu Sun, Yan Lin, Yuyang Xue +10Memory-Augmented VLMsMultimodal Memory

  21. DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

    Jul 30, 2026Jiacheng Tao, Qingyun Sun, Haonan Yuan +2Multimodal RAGGraph Retrieval-Augmented Generation

  22. LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

    Jul 30, 2026Enjun Du, Hange Zhou, Chenxu Du +4Multimodal GroundingMultimodal QA

  23. Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

    Jul 28, 2026Noor Islam S. Mohammad, Uluğ BayazıtMultimodal RAGEfficient Multimodal Inference

  24. DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

    Jul 27, 2026Shuo Wang, Kai Zhang, Wenyuan Huang +5Document UnderstandingMultimodal RAG

  25. HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

    Jul 26, 2026Xin He, Yili Wang, Wenqi Fan +4Multimodal RAGRetrieval-Augmented Generation

  26. Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangVLM DistillationMultimodal QA

  27. TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

    Jul 21, 2026Zhong Ji, Keqi Jin, Yan Zhang +1Multimodal RAGRetrieval-Augmented Generation

  28. Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists

    Jul 20, 2026Arnavi Chheda-Kothary, Lucy Lu Wang, Joseph Chee Chang +1Multimodal Large Language ModelsScientific QA

  29. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  30. Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

    Jul 16, 2026Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu +6Visual Question AnsweringVisual Spatial Reasoning

  31. EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

    Jul 14, 2026Jiashi Lin, Changhong Jiang, Xiangru Lin +12Multimodal RAGGraph Retrieval-Augmented Generation

  32. LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

    Jul 14, 2026Michael Solodko, Steven Gong, Guangwei Yu +3Multimodal QAAgentic Retrieval

  33. Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

    Jul 12, 2026Saadeldine Eletter, Owais Aijaz, Preslav NakovMultimodal RAGRetrieval-Augmented Generation

  34. UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

    Jul 12, 2026Xiyu Wei, Qingwei Zong, Zhuocheng Yu +1Multimodal QAAI Agent Benchmarks

  35. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual UnderstandingMultimodal Pretraining

  36. What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

    Jul 11, 2026Guanhua Ye, Niu Jingbin, Yan Li +4VLM EvaluationVisual Question Answering

  37. Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

    Jul 10, 2026Nirjhar Das, Md. Al-Mamun ProvathQuestion AnsweringMultimodal QA

  38. Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

    Jul 6, 2026Amol Harsh, Zongyan Han, Jean Lahoud +53D Spatial ReasoningMultimodal QA

  39. Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

    Jul 5, 2026Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu +2Efficient VLM InferenceMultimodal QA

  40. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekMultimodal QACross-Modal Attention

  41. Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

    Jul 3, 2026Xue Li, Yiming GaiMultimodal RAGEfficient Multimodal Inference

  42. EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

    Jul 2, 2026Gianmarco Spinaci, Lukas Klic, Giovanni ColavizzaEducational AssessmentMultimodal QA

  43. MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

    Jul 1, 2026Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi +7Multimodal QADocument QA

  44. Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach

    Jul 1, 2026Md Abu Hanif Shaikh, Abdullah Al ShafiMultimodal RAGMultimodal QA

  45. TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

    Jun 29, 2026Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA

  46. Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

    Jun 28, 2026Bohan Yao, Shruthan Radhakrishna, Vikas YadavMultimodal RAGMultimodal QA

  47. CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

    Jun 25, 2026Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed +3Radiology Report Generation3D Medical Imaging

  48. FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

    Jun 25, 2026Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi +1VLM EvaluationVisual Question Answering

  49. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  50. Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

    Jun 22, 2026Qian Ma, Qiong Wu, Zhengyi Zhou +1Multimodal RAGVisual Question Answering

  51. Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

    Jun 21, 2026Xiangyuan Xue, Yang Yu, Yan Gao +5Efficient Multimodal InferenceMultimodal QA

  52. EvidenceLens: A Claim-Evidence Matrix for Auditing Financial Question Answering

    Jun 19, 2026Fengchen Gu, Xiaotian Ren, Zhengyong Jiang +6Data VisualizationLLM Answer Verification

  53. CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

    Jun 18, 2026Yifan Shen, Pei Tian, Xinzhuo Li +8RL for Language Model ReasoningMixture-of-Experts Inference

  54. Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

    Jun 18, 2026Yuetian Du, Yucheng Wang, Ming Kong +4Multimodal QALanguage Model Calibration