Multimodal QA

QA: Question Answering

Momentum

11 papers in the last four weeks, up 22% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 131

All topics
CardsList
  1. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  2. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  3. FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

    May 13, 2026Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad +2Financial ServicesFinancial QA

  4. Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

    May 12, 2026Armin Zarbaft, Ehsan Karimi, Nhut Le +1Disaster Damage AssessmentLLM Prompting

  5. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Cross-Modal LearningMultimodal QA

  6. DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

    May 9, 2026Xiang Feng, Jiawei Zhou, Zhangfeng Huang +6LLM GroundingLLM Answer Verification

  7. Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

    May 9, 2026Tao Yu, yiming ding, Shenghua Chai +16Multi-Hop QAMultimodal IR

  8. KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

    May 5, 2026Archishman Ghosh, Abhinaba Roy, Dorien HerremansAudio-Visual UnderstandingVideo QA

  9. DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

    May 2, 2026Jincheng Lou, Ruohan Xu, Jiapeng Li +6Multi-Agent LLM SystemsElectronic Design Automation

  10. Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

    Apr 28, 2026Jianghang Lin, Haihua Yang, Deli Yu +6Training Data CurationMultimodal QA

  11. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  12. Can Multimodal Large Language Models Truly Understand Small Objects?

    Apr 24, 2026Fujun Han, Junan Chen, Xintong Zhu +4Multimodal QAMultimodal Model Evaluation

  13. ChangeQuery: Advancing Remote Sensing Change Analysis for Natural and Human-Induced Disasters from Visual Detection to Semantic Understanding

    Apr 24, 2026Dongwei Sun, Jing Yao, Kan Wei +6Remote Sensing Image UnderstandingDisaster Damage Assessment

  14. Towards Temporal Compositional Reasoning in Long-Form Sports Videos

    Apr 24, 2026Siyu Cao, Lu Zhang, Ruizhe Zeng +1Temporal Video GroundingTemporal Reasoning

  15. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  16. AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

    Apr 23, 2026Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar +3Audio QAAudio Reasoning

  17. Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

    Apr 23, 2026Chentao Li, Zirui Gao, Mingze Gao +3Multimodal QAVision-Language Grounding

  18. HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration

    Apr 23, 2026Yuehan Zhu, Jingqi Zhao, Jiawen Zhao +2Multi-Agent CollaborationMultimodal QA

  19. ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

    Apr 23, 2026Stephan Xie, Ben Cohen, Mononito Goswami +6Time Series ReasoningTime Series QA

  20. WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

    Apr 22, 2026Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik +2Thermal ImagingVisual Question Answering

  21. A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

    Apr 21, 2026Shuai Wang, Hongyi Zhu, Jia-Hong Huang +6Multimodal RAGMultimodal Grounding

  22. DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

    Apr 21, 2026Shengqin Wang, Wentao Yan, Huichi Zhou +4Reward ShapingRL for Language Model Reasoning

  23. Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

    Apr 19, 2026Shaoguang Wang, Weiyu Guo, Ziyang Chen +2Multimodal Large Language ModelsMultimodal QA

  24. LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

    Apr 18, 2026Yifan Zhu, Yu Mi, Yue Lu +2Multimodal RAGLate Interaction Retrieval

  25. Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

    Apr 16, 2026Nishanth Madhusudhan, Vikas Yadav, Alexandre LacosteMultimodal QAMultimodal Reasoning

  26. SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

    Apr 14, 2026Tanzila Rahman, Renjie Liao, Leonid SigalSynthetic-to-Real Domain AdaptationSynthetic Data Augmentation

  27. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Vision-Language ModelsMultimodal QA

  28. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Mar 19, 2026Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1Multimodal Large Language ModelsMultimodal QA