Knowledge-Based Visual Question Answering

Latest papers 63

All topics
CardsList
  1. Fusing Visual and Textual Representations via Multi-layer Fusing Transformers for Vietnamese Visual Question Answering

    Oct 1, 2026Cong Phu Nguyen, Huy Tien Nguyen, Tung LeKnowledge-Based Visual Question AnsweringVideo Dataset

  2. Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding

    Sep 29, 2026Jiayu Ying, Qijian Tian, Ruijie Xu +4Knowledge-Based Visual Question AnsweringMultimodal Agents

  3. TAEC: Trajectory-Aware Evidence Coordination for Multi-Step Visual RAG

    Sep 29, 2026Yalun Wu, Bingzhou Wang, Boyang Wang +5Visual EvidenceMultimodal Retrieval Augmented Generation

  4. From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model

    Sep 24, 2026Xunlan Zhou, Xianliang Yang, Li ZhaoKnowledge-Based Visual Question AnsweringPixels

  5. When Visual Quality Misleads: Intent Recognition under Rendered Avatar Distortions

    Sep 23, 2026Ning-Hsuan Chang, Kai-Siang Ma, Yu-Chih ChenVisual FidelityOpen-Vocabulary Action Recognition

  6. Hierarchical Floorplan-Guided Vision-Language Exploration for Embodied Question Answering

    Sep 22, 2026Albert Gassol Puigjaner, Kostas AlexisVision-Language NavigationKnowledge-Based Visual Question Answering

  7. A2^2Safe: Counterfactual Evidence-Aligned Adaptive Agent Collaboration for Safe and Effective Visual Question Answering

    Sep 21, 2026Quanxing Xu, Ling Zhou, Xian Zhong +4Knowledge-Based Visual Question AnsweringMultimodal Query

  8. Counterfactual Reasoning for Robust Visual Question Answering

    Sep 15, 2026Truong-Binh Duong, Thanh-Ngan Tran, Ngoc-Thao Nguyen +1Knowledge-Based Visual Question AnsweringVisual Question Answering Benchmarks

  9. Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation

    Sep 14, 2026Yucheng Shen, Lingyong Yan, Jiulong Wu +4Visual EvidenceKnowledge-Based Visual Question Answering

  10. SparseTalk - Sparsifying 3D Gaussian Language Fields for Efficient 3D Visual Question Answering

    Sep 14, 2026Davit Soselia, Joseph JaJa, Amitabh Varshney3D RepresentationKnowledge-Based Visual Question Answering

  11. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Multimodal AgentsAgentic Reasoning

  12. ManGo: Manga Active Narrative Grounding Optimization

    Aug 30, 2026Hao Qiu, Junyan Wang, Zheyuan Liu +4Knowledge-Based Visual Question AnsweringVision-Language Model Grounding

  13. DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

    Aug 11, 2026Zhuchenyang Liu, Ziyi Wang, Yao Zhang +1Visual Document RetrievalMultimodal Retrieval

  14. Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

    Aug 3, 2026Jingchen Sun, Shaobo Han, Ruiyi Zhang +5Knowledge-Based Visual Question AnsweringMultimodal Retrieval

  15. VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval

    Aug 2, 2026Haocheng Wang, Tongkun Guan, Wei Shen +1Visual Document RetrievalMultimodal Retrieval

  16. UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

    Aug 2, 2026Ganzhong Luo, Yang Ren, Hanyong Wang +2Knowledge-Based Visual Question AnsweringReranking

  17. RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

    Aug 1, 2026Jiayang Yu, Jialun Zhong, Lei ZouKnowledge-Based Visual Question AnsweringLingdt-Vl-Ocr

  18. Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

    Jul 30, 2026Zhongkuan Mao, Xianjie Liu, Tianyu Meng +9Knowledge-Based Visual Question AnsweringHigh-Resolution

  19. DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

    Jul 27, 2026Yue Zhang, Xiangyu Li, Wanshu Fan +2Knowledge-Based Visual Question AnsweringSelf-Supervised Vision Transformers

  20. CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

    Jul 23, 2026Hanseok Oh, Parishad BehnamGhader, Benno Krojer +4Knowledge-Based Visual Question AnsweringDiagnostic Benchmark

  21. VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

    Jul 22, 2026Yanbin Wei, Yang Chen, Renling Gan +7Graph-Based Retrieval Augmented GenerationKnowledge-Based Visual Question Answering

  22. WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

    Jul 12, 2026Khush Kataruka, Harshit Maurya, Anuja Vats +3WasteKnowledge-Based Visual Question Answering

  23. MMAgent-R2^2: Learning to Rerank and Reject for Agentic mRAG

    Jul 8, 2026Tao Zhang, Ziqi Zhang, Zongyang Ma +7Knowledge-Based Visual Question AnsweringMultimodal Retrieval Augmented Generation

  24. Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

    Jun 30, 2026Qian Ma, S M Rayeed, Charles V. Stewart +2Visual Question Answering BenchmarksKnowledge-Based Visual Question Answering

  25. ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

    Jun 26, 2026ZhengXian Wu, Hangrui Xu, Kai Shi +8Knowledge-Based Visual Question AnsweringMultimodal Search Agents

  26. SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

    Jun 24, 2026Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang +8Surgical VideosSurgery

  27. Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

    Jun 24, 2026Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar +3Visual Document RetrievalKnowledge-Based Visual Question Answering

  28. LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

    Jun 22, 2026Tongkun Guan, Haocheng Wang, Wei Shen +1Visual Document RetrievalMultimodal Retrieval

  29. Enhancing Pathological VLMs with Cross-scale Reasoning

    Jun 16, 2026Chi Phan, Tianyi Zhang, Qiaochu Xue +5Medical Vision-Language ModelsKnowledge-Based Visual Question Answering

  30. Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

    Jun 15, 2026Jieyuan Liu, Jianyang Gu, Shijie Chen +2Knowledge-Based Visual Question AnsweringQuestion

  31. Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

    Jun 2, 2026Thomas Eiter, Nelson Higuera Ruiz, Johannes OetschKnowledge-Based Visual Question AnsweringNeuro-Symbolic Framework

  32. Disentanglement-Based Equivariant Learning for Compositional VQA

    Jun 1, 2026Zhou Du, Zhaoquan Yuan, Xiao Wu +1Knowledge-Based Visual Question AnsweringEquivariant Learning

  33. Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search

    May 29, 2026Gyu-Hwung Cho, Youngjune Lee, Kiyoon Jeong +5Visual Document RetrievalMultimodal Retrieval

  34. Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

    May 29, 2026Yuhan Wang, Shuochen Chang, Yalin Feng +8Knowledge-Based Visual Question AnsweringMultimodal Agents

  35. Rethinking VLM Representation for VLA Initialization

    May 25, 2026Weifeng Lin, Siyuan Huang, Hao Li +5Vision-Language-Action FrameworkScalable Robot Learning

  36. RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

    May 21, 2026Chengyi Zhang, Zi Ye, Ziyang WangTextvqaKnowledge-Based Visual Question Answering

  37. HyLoVQA: Dynamic Hypernetwork-Generated Low-Rank Adaptation for Continual Visual Question Answering

    May 21, 2026Yiran Wang, Chenyi Xiong, Ziyue Qin +3Knowledge-Based Visual Question AnsweringVision-Language Model Adaptation

  38. MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

    May 19, 2026Quanxing Xu, Yuhao Tian, Ling Zhou +4Knowledge-Based Visual Question AnsweringMetamorphic Relation Adequacy

  39. MedFM-Robust: Benchmarking Robustness of Medical Foundation Models

    May 18, 2026Xiangxiang Cui, Tianjin Huang, Yifang Wang +2Medical Vision-Language ModelsMedical Imaging

  40. Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval

    May 17, 2026Xianke Chen, Daizong Liu, Yushuo Lou +5Composed Image RetrievalKnowledge-Based Visual Question Answering

  41. Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA

    May 14, 2026Guanhua Chen, Yutong Yao, Shenghe Sun +5Knowledge-Based Visual Question AnsweringMultimodal Benchmarks

  42. Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

    May 5, 2026Quanxing Xu, Ling Zhou, Xian Zhong +3Knowledge-Based Visual Question AnsweringMultimodal Large Language Models

  43. Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

    May 2, 2026Peiyang Liu, Ziqiang Cui, Xi Wang +2Multimodal Retrieval Augmented GenerationKnowledge-Based Visual Question Answering

  44. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Knowledge-Based Visual Question AnsweringMultimodal Reasoning

  45. HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA

    Apr 26, 2026Francesco Dibitonto, Cigdem Beyan, Vittorio MurinoKnowledge-Based Visual Question AnsweringContrastive Language-Image Pre-Training Model

  46. BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

    Apr 24, 2026Jinghong Chen, Jingbiao Mei, Guangyu Yang +1Knowledge-Based Visual Question AnsweringContext Length

  47. AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

    Apr 20, 2026Junxiao Xue, Quan Deng, Tingqi Hu +4Knowledge-Based Visual Question AnsweringMultimodal Retrieval Augmented Generation

  48. AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation

    Apr 19, 2026Rongsheng Hu, Runwei Guan, Yicheng Di +2Knowledge-Based Visual Question AnsweringTextvqa

  49. VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

    Apr 17, 2026Xiangbo Gao, Sicong Jiang, Bangya Liu +12Video EditingMulti-Image Editing Benchmarks

  50. AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

    Apr 16, 2026Peifeng Zhang, Zice Qiu, Donghua Yu +4Knowledge-Based Visual Question AnsweringMultiple-Choice Visual Question Answering

  51. Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

    Apr 8, 2026Zhuohong Chen, Zhenxian Wu, Yunyao Yu +6Knowledge-Based Visual Question Answering

  52. Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

    Mar 5, 2026Shan Ning, Longtian Qiu, Xuming HeKnowledge-Based Visual Question AnsweringVisual Question Answering Benchmarks