Multimodal QA

QA: Question Answering

Momentum

11 papers in the last four weeks, up 22% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 131

All topics
CardsList
  1. ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

    Jun 11, 2026Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya +2Multilingual Language ModelsRL for Language Model Reasoning

  2. MSUE: Multi-Modal Soccer Understanding Expert

    Jun 10, 2026Litao Li, Yibo Yu, Yufeng Hu +4Visual Question AnsweringVideo QA

  3. IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

    Jun 10, 2026Yifan Yang, Zhen Zhang, Jiayi Tian +2Tool Use in VLMsReinforcement Learning

  4. One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

    Jun 9, 2026Zhi Zheng, Ziqiao Meng, Hao Luan +2Multimodal RAGMultimodal Memory

  5. MMClima: A Framework for Multimodal Climate Science Data and Evaluation

    Jun 8, 2026Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad +2Climate ScienceScientific QA

  6. ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

    Jun 8, 2026Yi Zhang, Bolei Ma, Yong Cao +3VLM EvaluationVisual Question Answering

  7. ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

    Jun 6, 2026Bin Zhu, Yanhao Jia, Kexin Zhao +12Physical ReasoningMultimodal QA

  8. SPARC: A Multi-Agent System for Electrical Circuit Question Answering

    Jun 5, 2026Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia +3Multi-Agent LLM SystemsQuestion Answering

  9. FLOWREADER: Min-Cost Flow Optimization for Multi-Modal Long Document Q&A

    Jun 5, 2026Ambuj Mehrish, Sebastiano VasconMultimodal RAGMultimodal QA

  10. MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

    Jun 4, 2026Kaifeng Chen, Hongtao Liu, Qiyao Peng +4Multimodal RAGMultimodal QA

  11. MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

    Jun 2, 2026Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal +7Multimodal RAGMultimodal QA

  12. OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

    Jun 2, 2026Yifei Li, Pengyiang Liu, Yuhang Zang +4Spatial Reasoning BenchmarksSpatiotemporal Reasoning

  13. SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series

    Jun 2, 2026Galann Pennec, Zhengyuan Liu, Nicholas Asher +2LLM PlanningMultimodal QA

  14. PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

    Jun 1, 2026Yichuan Wang, Zhifei Li, Zirui Wang +5Multimodal RAGMultimodal QA

  15. V-LynX: Token Interface Alignment for Video+X LLMs

    May 30, 2026Jungin Park, Jiyoung Lee, Kwanghoon SohnCross-Modal AlignmentMultimodal QA

  16. MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

    May 29, 2026Qian Kou, Xiaofeng Shi, Yulin Li +4Visual Spatial ReasoningMultimodal Large Language Models

  17. DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

    May 28, 2026Junzhe Zhang, Huixuan Zhang, Guirong Wang +5Counterfactual EvaluationCounterfactual Reasoning in Language Models

  18. DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

    May 27, 2026Jiamian Wang, Ruiyi Zhang, Tong Yu +5Multimodal IRMultimodal QA

  19. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  20. StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

    May 25, 2026Ming Xie, Zizheng Huang, Xudong Tan +6Audio-Visual UnderstandingStreaming Video Understanding

  21. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding

  22. M3QuestionIngM^3 QuestionIng: Multi-modal Multi-span Medical Question Answering

    May 19, 2026Anisha Saha, Vaibhav Rathore, Abhisek Tiwari +3Medical VQAMultimodal QA

  23. PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow

    May 18, 2026Chengyang Zhang, Wenchuan Zhang, Bo Li +5Computational PathologyEvidence-Grounded Reasoning

  24. MARS: Technical Report for the CASTLE Challenge at EgoVis 2026

    May 18, 2026Haoyu Zhang, Qiaohui Chu, Yisen Feng +4Egocentric Video QAEgocentric Video Understanding

  25. GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

    May 15, 2026Junho Kim, Xu Cao, Houze Yang +6Multimodal QAMultimodal Model Evaluation

  26. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  27. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  28. FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

    May 13, 2026Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad +2Financial ServicesFinancial QA

  29. Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

    May 12, 2026Armin Zarbaft, Ehsan Karimi, Nhut Le +1Disaster Damage AssessmentLLM Prompting

  30. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Cross-Modal LearningMultimodal QA

  31. DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

    May 9, 2026Xiang Feng, Jiawei Zhou, Zhangfeng Huang +6LLM GroundingLLM Answer Verification

  32. Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

    May 9, 2026Tao Yu, yiming ding, Shenghua Chai +16Multi-Hop QAMultimodal IR

  33. KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

    May 5, 2026Archishman Ghosh, Abhinaba Roy, Dorien HerremansAudio-Visual UnderstandingVideo QA

  34. DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

    May 2, 2026Jincheng Lou, Ruohan Xu, Jiapeng Li +6Multi-Agent LLM SystemsElectronic Design Automation

  35. Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

    Apr 28, 2026Jianghang Lin, Haihua Yang, Deli Yu +6Training Data CurationMultimodal QA

  36. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  37. Can Multimodal Large Language Models Truly Understand Small Objects?

    Apr 24, 2026Fujun Han, Junan Chen, Xintong Zhu +4Multimodal QAMultimodal Model Evaluation

  38. ChangeQuery: Advancing Remote Sensing Change Analysis for Natural and Human-Induced Disasters from Visual Detection to Semantic Understanding

    Apr 24, 2026Dongwei Sun, Jing Yao, Kan Wei +6Remote Sensing Image UnderstandingDisaster Damage Assessment

  39. Towards Temporal Compositional Reasoning in Long-Form Sports Videos

    Apr 24, 2026Siyu Cao, Lu Zhang, Ruizhe Zeng +1Temporal Video GroundingTemporal Reasoning

  40. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  41. AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

    Apr 23, 2026Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar +3Audio QAAudio Reasoning

  42. Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

    Apr 23, 2026Chentao Li, Zirui Gao, Mingze Gao +3Multimodal QAVision-Language Grounding

  43. HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration

    Apr 23, 2026Yuehan Zhu, Jingqi Zhao, Jiawen Zhao +2Multi-Agent CollaborationMultimodal QA

  44. ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

    Apr 23, 2026Stephan Xie, Ben Cohen, Mononito Goswami +6Time Series ReasoningTime Series QA

  45. WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

    Apr 22, 2026Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik +2Thermal ImagingVisual Question Answering

  46. A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

    Apr 21, 2026Shuai Wang, Hongyi Zhu, Jia-Hong Huang +6Multimodal RAGMultimodal Grounding

  47. DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

    Apr 21, 2026Shengqin Wang, Wentao Yan, Huichi Zhou +4Reward ShapingRL for Language Model Reasoning

  48. Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

    Apr 19, 2026Shaoguang Wang, Weiyu Guo, Ziyang Chen +2Multimodal Large Language ModelsMultimodal QA

  49. LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

    Apr 18, 2026Yifan Zhu, Yu Mi, Yue Lu +2Multimodal RAGLate Interaction Retrieval

  50. Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

    Apr 16, 2026Nishanth Madhusudhan, Vikas Yadav, Alexandre LacosteMultimodal QAMultimodal Reasoning

  51. SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

    Apr 14, 2026Tanzila Rahman, Renjie Liao, Leonid SigalSynthetic-to-Real Domain AdaptationSynthetic Data Augmentation

  52. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Vision-Language ModelsMultimodal QA

  53. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Mar 19, 2026Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1Multimodal Large Language ModelsMultimodal QA