Knowledge-Based VQA

VQA: Visual Question Answering

Momentum

0 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 23

All topics
CardsList
  1. A doctrine-grounded visual question answering dataset for Tactical Combat Casualty Care

    Oct 5, 2026Junseob Kim, Jade Chng, Ayman Ali +5Medical VQAVideo QA

  2. JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

    Aug 12, 2026Ran Li, Huiguo He, Jiahuan Cao +3VLM EvaluationVLM Reasoning

  3. Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

    Aug 3, 2026Jingchen Sun, Shaobo Han, Ruiyi Zhang +5Multimodal IRContrastive Learning

  4. UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

    Aug 2, 2026Ganzhong Luo, Yang Ren, Hanyong Wang +2Multimodal IRMultimodal Reranking

  5. Distilling Answer Set Programming Theories from Large Language Models

    Jul 30, 2026Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-CondreiLogic ProgrammingLLM-Based Program Synthesis

  6. Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

    Jul 28, 2026Noor Islam S. Mohammad, Uluğ BayazıtMultimodal RAGEfficient Multimodal Inference

  7. CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

    Jul 23, 2026Hanseok Oh, Parishad BehnamGhader, Benno Krojer +4VLM EvaluationMultimodal RAG

  8. WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

    Jul 12, 2026Khush Kataruka, Harshit Maurya, Anuja Vats +3Visual Question AnsweringKnowledge-Based VQA

  9. MMAgent-R2^2: Learning to Rerank and Reject for Agentic mRAG

    Jul 8, 2026Tao Zhang, Ziqi Zhang, Zongyang Ma +7Multimodal RAGAdaptive Retrieval

  10. Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

    Jun 30, 2026Qian Ma, S M Rayeed, Charles V. Stewart +2VLM EvaluationVisual Question Answering

  11. ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

    Jun 26, 2026ZhengXian Wu, Hangrui Xu, Kai Shi +8Multimodal RAGMultimodal Search Agents

  12. Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

    Jun 22, 2026Qian Ma, Qiong Wu, Zhengyi Zhou +1Multimodal RAGVisual Question Answering

  13. VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories

    Jun 15, 2026Svetlana Lukina, Mohamad Al Mdfaa, Gloria Haro +2Egocentric Video QAVideo QA

  14. Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

    Jun 15, 2026Jieyuan Liu, Jianyang Gu, Shijie Chen +2VLM EvaluationMultimodal RAG

  15. Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

    May 5, 2026Quanxing Xu, Ling Zhou, Xian Zhong +3Multimodal RAGVisual Question Answering

  16. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  17. BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

    Apr 24, 2026Jinghong Chen, Jingbiao Mei, Guangyu Yang +1Visual Question AnsweringRetrieval-Augmented Generation

  18. KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

    Apr 18, 2026Parthaw Goswami, Jaynto Goswami DeepMultimodal RAGVisual Reasoning

  19. Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

    Apr 8, 2026Zhuohong Chen, Zhenxian Wu, Yunyao Yu +6Visual Question AnsweringTool Use in VLMs

  20. Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

    Mar 5, 2026Shan Ning, Longtian Qiu, Xuming HeVisual Question AnsweringReinforcement Learning

  21. From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

    Nov 14, 2025Yu Zhao, Ying Zhang, Xuhui Sui +4Visual Question AnsweringCoT Distillation