Multimodal Query

Momentum

5 papers in the last four weeks, up 67% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 32

All topics
CardsList
  1. Seeing and Solving Are Not Enough for Vision-Language Models

    Sep 27, 2026Ziheng Wang, Mingxuan Xie, Yilin Liu +3Multimodal QueryState-Tracking

  2. MoGround: Measuring and Mitigating Modality Distraction in Vision-Language Models

    Sep 27, 2026Luca Zhou, Bo Zhao, Rose Yu +2ModalitiesMultimodal Query

  3. TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs

    Sep 24, 2026Kaidi Yang, Hualei Wang, Zhaohui Wang +3Temporal GroundingAudio Understanding

  4. A2^2Safe: Counterfactual Evidence-Aligned Adaptive Agent Collaboration for Safe and Effective Visual Question Answering

    Sep 21, 2026Quanxing Xu, Ling Zhou, Xian Zhong +4Knowledge-Based Visual Question AnsweringMultimodal Query

  5. Evolution of Multimodal Question Answering: From Modality-Adaptive Extraction to Unified Language Representation

    Sep 8, 2026Abdullah Al ShafiMultimodal QueryMultimodal Reasoning

  6. EM^2Mem: Event-Centric Multimodal Memory for Large Language Models

    Sep 1, 2026Yijun Chen, Yaqi Zheng, Yanya Li +11Multimodal MemoryMultimodal Query

  7. Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering

    Aug 31, 2026Jueun Kim, Sungho Park, Wook-Shin HanMulti-Hop ReasoningMultimodal Query

  8. XHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question Answering

    Aug 23, 2026Iman Barati, Arash Ghafouri, Behrouz Minaei-BidgoliMultimodal QueryMulti-Hop Reasoning

  9. Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

    Jul 30, 2026Fexiang Liu, Shiye Wang, Qiang Qiu +1Reference-Guided Multimodal In-Context VerificationMultiple-Choice Visual Question Answering

  10. Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

    Jul 28, 2026Noor Islam S. Mohammad, Uluğ BayazıtMultimodal QueryCross-Modal

  11. Diverse-Intent Multi-Turn Fashion Image Retrieval

    Jul 22, 2026Mingqiang Tang, Haokun Wen, Meng Liu +3GarmentsMultimodal Query

  12. TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

    Jul 21, 2026Zhong Ji, Keqi Jin, Yan Zhang +1Multimodal QueryHievi-Rag

  13. Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

    Jul 16, 2026Harikrishnan P M, Goutham Vignesh, Ganesh Parab +4Multimodal QueryMultimodal Documents

  14. LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

    Jul 14, 2026Michael Solodko, Steven Gong, Guangwei Yu +3Data LakesMultimodal Query

  15. Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents

    Jul 13, 2026Ming Ma, Yi Zhu, Yiran Zhong +6Omni-ModalMultimodal Query

  16. STEC: Evidence Compression for Deep Search in Open-domain Multi-Hop QA

    Jul 12, 2026Xinkang Li, Rong Jiang, Xin Song +3Multi-Hop ReasoningMultimodal Query

  17. CLIR-Bench: Benchmarking Multimodal Question Answering over Irregular Clinical Time Series

    Jul 10, 2026Frank Nie, Ethan B. Liu, Yuan Zhu +3Time SeriesMultimodal Query

  18. Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

    Jul 10, 2026Nirjhar Das, Md. Al-Mamun ProvathMultimodal QueryReasoning Skills

  19. StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering

    May 23, 2026Yuelyu Ji, Zhuochun Li, Hui Ji +1Multi-Hop ReasoningEvidence Conflict

  20. M3QuestionIngM^3 QuestionIng: Multi-modal Multi-span Medical Question Answering

    May 19, 2026Anisha Saha, Vaibhav Rathore, Abhisek Tiwari +3Multimodal Clinical DataMultimodal Query

  21. QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

    Apr 27, 2026Woojun Jung, Junyeong KimSummarizationMultimodal Evaluation

  22. Multimodal QUD: Inquisitive Questions from Scientific Figures

    Apr 26, 2026Yating Wu, William Rudman, Venkata S Govindarajan +2Multimodal QueryMultimodal Reasoning

  23. TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

    Apr 23, 2026Zixu Li, Yupeng Hu, Zhiheng Fu +3Composed Image RetrievalImage-Text Pairs

  24. Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

    Apr 23, 2026Azher Ahmed Efat, Seok Hwan Song, Wallapak TavanapongChartMultimodal Query

  25. INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval

    Apr 20, 2026Zhiwei Chen, Yupeng Hu, Zhiheng Fu +4Composed Image RetrievalNoise-Aware

  26. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Multimodal QueryTextual Priors

  27. ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

    Mar 24, 2026Hyojin Park, Yi Li, Janghoon Cho +8Long Video Question AnsweringVideo Surveillance

  28. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Mar 19, 2026Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1Long Video Question AnsweringVideo Multimodal Large Language Models

  29. RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

    Feb 4, 2026Gaia A. Bertolino, Yuwei Zhang, Tong Xia +2Large Audio Language ModelsMultimodal Query

  30. DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework

    Feb 1, 2026Abhijit Chakraborty, Ashish Raj Shekhar, Shiven Agarwal +1Multimodal QueryMultimodal Agents

  31. Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

    Jan 31, 2026Tong Wang, Yunhan Zhao, Shu KongZero-Shot Composed Image RetrievalComposed Image Retrieval