Multimodal QA

QA: Question Answering

Momentum

11 papers in the last four weeks, up 22% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 131

All topics
CardsList
  1. ReCast: Contract-Preserving Protection for Fixed-Interface Multimodal Reasoning

    Oct 1, 2026Bingchen Pei, Lichong Chen, Bingxi Zhao +8Multimodal QAMultimodal Reasoning

  2. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  3. WeaveData: A Multimodal Data Analysis System with Self-Critiquing and Self-Evolving LLM Plans

    Sep 28, 2026Min Jia, Shihao Zhou, Jun-Peng Zhu +9LLM Self-RefinementLLM Planning

  4. Spatial Action Review: A Visual Analytics Dashboard for Auditing Language-to-Action Hand-offs in Electron Microscopy

    Sep 21, 2026Samia Mohinta, Albert CardonaHuman-in-the-Loop EvaluationMultimodal QA

  5. A2^2Safe: Counterfactual Evidence-Aligned Adaptive Agent Collaboration for Safe and Effective Visual Question Answering

    Sep 21, 2026Quanxing Xu, Ling Zhou, Xian Zhong +4Visual Question AnsweringLLM Safety Alignment

  6. PRISM-RAG: Multimodal Hypergraph Retrieval-Augmented Generation for Tobacco Product and Legislative Policy Reasoning

    Sep 20, 2026Manuel Serna-Aguilera, Raegan Anderes, Page Dobbs +1Multimodal RAGLegal IR

  7. Less Is More: Graph-free Multimodal RAG via Multi-signal Late Fusion

    Sep 16, 2026Tithi Rakshit, Hongkuan Zhou, Lavdim Halilaj +1Multimodal RAGMultimodal IR

  8. Evolution of Multimodal Question Answering: From Modality-Adaptive Extraction to Unified Language Representation

    Sep 8, 2026Abdullah Al ShafiUnified Multimodal ModelsMultimodal QA

  9. Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment

    Sep 8, 2026Zhan-Lun Chang, Dong-Jun Han, Seyyedali Hosseinalipour +2Multimodal RAGMultimodal Reranking

  10. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Tool Use in VLMsMultimodal QA

  11. ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

    Aug 31, 2026Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti +11Hallucination DetectionT2I Generation

  12. Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

    Aug 31, 2026Jaehee Kim, Ji Hoon Chung, Seoyoon Park +5Multimodal QAMultilingual VLM Evaluation

  13. ManGo: Manga Active Narrative Grounding Optimization

    Aug 30, 2026Hao Qiu, Junyan Wang, Zheyuan Liu +4Visual Question AnsweringRL for Language Model Reasoning

  14. CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

    Aug 13, 2026Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud +2LLM Answer VerificationLLM Hallucination Mitigation

  15. HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation

    Aug 13, 2026Yunhao Bai, Zhongwei Qiu, Guangyu Guo +5Medical Report GenerationWorld Model Learning

  16. Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

    Aug 12, 2026Weihao Bo, Shan Zhang, Yanpeng Sun +7Code GenerationMultimodal QA

  17. Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

    Aug 12, 2026Haoyu Zhang, Shuoxun Zhang, Peng Ye +5Visual Question AnsweringMulti-Agent LLM Systems

  18. When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

    Aug 5, 2026Yongxin Wang, Ruizhe Zhou, Yueling Tang +4Multimodal QAMultimodal Reasoning

  19. LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

    Aug 2, 2026Ziyan Xiao, Yinghao Zhu, Wenting Zhang +2Data VisualizationVisual Reasoning

  20. PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

    Aug 2, 2026Jingyu Sun, Yan Lin, Yuyang Xue +10Memory-Augmented VLMsMultimodal Memory

  21. DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

    Jul 30, 2026Jiacheng Tao, Qingyun Sun, Haonan Yuan +2Multimodal RAGGraph Retrieval-Augmented Generation

  22. LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

    Jul 30, 2026Enjun Du, Hange Zhou, Chenxu Du +4Multimodal GroundingMultimodal QA

  23. Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

    Jul 28, 2026Noor Islam S. Mohammad, Uluğ BayazıtMultimodal RAGEfficient Multimodal Inference

  24. DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

    Jul 27, 2026Shuo Wang, Kai Zhang, Wenyuan Huang +5Document UnderstandingMultimodal RAG

  25. HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

    Jul 26, 2026Xin He, Yili Wang, Wenqi Fan +4Multimodal RAGRetrieval-Augmented Generation

  26. Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangVLM DistillationMultimodal QA