Multimodal QA

QA: Question Answering

Momentum

11 papers in the last four weeks, up 22% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 131

All topics
CardsList
  1. ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

    Jun 11, 2026Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya +2Multilingual Language ModelsRL for Language Model Reasoning

  2. MSUE: Multi-Modal Soccer Understanding Expert

    Jun 10, 2026Litao Li, Yibo Yu, Yufeng Hu +4Visual Question AnsweringVideo QA

  3. IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

    Jun 10, 2026Yifan Yang, Zhen Zhang, Jiayi Tian +2Tool Use in VLMsReinforcement Learning

  4. One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

    Jun 9, 2026Zhi Zheng, Ziqiao Meng, Hao Luan +2Multimodal RAGMultimodal Memory

  5. MMClima: A Framework for Multimodal Climate Science Data and Evaluation

    Jun 8, 2026Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad +2Climate ScienceScientific QA

  6. ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

    Jun 8, 2026Yi Zhang, Bolei Ma, Yong Cao +3VLM EvaluationVisual Question Answering

  7. ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

    Jun 6, 2026Bin Zhu, Yanhao Jia, Kexin Zhao +12Physical ReasoningMultimodal QA

  8. SPARC: A Multi-Agent System for Electrical Circuit Question Answering

    Jun 5, 2026Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia +3Multi-Agent LLM SystemsQuestion Answering

  9. FLOWREADER: Min-Cost Flow Optimization for Multi-Modal Long Document Q&A

    Jun 5, 2026Ambuj Mehrish, Sebastiano VasconMultimodal RAGMultimodal QA

  10. MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

    Jun 4, 2026Kaifeng Chen, Hongtao Liu, Qiyao Peng +4Multimodal RAGMultimodal QA

  11. MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

    Jun 2, 2026Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal +7Multimodal RAGMultimodal QA

  12. OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

    Jun 2, 2026Yifei Li, Pengyiang Liu, Yuhang Zang +4Spatial Reasoning BenchmarksSpatiotemporal Reasoning

  13. SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series

    Jun 2, 2026Galann Pennec, Zhengyuan Liu, Nicholas Asher +2LLM PlanningMultimodal QA

  14. PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

    Jun 1, 2026Yichuan Wang, Zhifei Li, Zirui Wang +5Multimodal RAGMultimodal QA

  15. V-LynX: Token Interface Alignment for Video+X LLMs

    May 30, 2026Jungin Park, Jiyoung Lee, Kwanghoon SohnCross-Modal AlignmentMultimodal QA

  16. MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

    May 29, 2026Qian Kou, Xiaofeng Shi, Yulin Li +4Visual Spatial ReasoningMultimodal Large Language Models

  17. DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

    May 28, 2026Junzhe Zhang, Huixuan Zhang, Guirong Wang +5Counterfactual EvaluationCounterfactual Reasoning in Language Models

  18. DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

    May 27, 2026Jiamian Wang, Ruiyi Zhang, Tong Yu +5Multimodal IRMultimodal QA

  19. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  20. StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

    May 25, 2026Ming Xie, Zizheng Huang, Xudong Tan +6Audio-Visual UnderstandingStreaming Video Understanding

  21. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding

  22. M3QuestionIngM^3 QuestionIng: Multi-modal Multi-span Medical Question Answering

    May 19, 2026Anisha Saha, Vaibhav Rathore, Abhisek Tiwari +3Medical VQAMultimodal QA

  23. PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow

    May 18, 2026Chengyang Zhang, Wenchuan Zhang, Bo Li +5Computational PathologyEvidence-Grounded Reasoning

  24. MARS: Technical Report for the CASTLE Challenge at EgoVis 2026

    May 18, 2026Haoyu Zhang, Qiaohui Chu, Yisen Feng +4Egocentric Video QAEgocentric Video Understanding

  25. GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

    May 15, 2026Junho Kim, Xu Cao, Houze Yang +6Multimodal QAMultimodal Model Evaluation