3D VQA

VQA: Visual Question Answering

Momentum

6 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 23

All topics
CardsList
  1. Lens3D: Target-Conditioned Visual Foveation for Fine-Grained 3D Understanding

    Oct 5, 2026Junming Huang, Zini Chen, Shuaiying Hou +3Active View Selection3D VQA

  2. Render to Reason: Novel-View Semantic Prediction Improves Spatial Understanding in VLMs

    Oct 4, 2026Yuqun Wu, Yao Xiao, Chuhang Zou +2Visual Spatial Reasoning3D VQA

  3. Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding

    Sep 29, 2026Jiayu Ying, Qijian Tian, Ruijie Xu +4Visual Question AnsweringMultimodal Large Language Models

  4. Long Time No See: Benchmarking VLMs for Out-of-Sight Spatiotemporal Reasoning in Egocentric Videos

    Sep 28, 2026Fangzhou Ma, Ivo Alexander Ban, Eren Homburg +5Temporal Video GroundingVisual Spatial Reasoning

  5. SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning

    Sep 27, 2026Yang Cao, Jiaxin Zhang, Dave Zhenyu Chen +4Visual Spatial Reasoning3D Spatial Reasoning

  6. SceneScaffold: Active Scene-State Construction for Unified 3D Scene Understanding

    Sep 27, 2026Xiangqi Li, Libo Huang, Jiarui Zhao +43D Scene Representation3D VQA

  7. SparseTalk - Sparsifying 3D Gaussian Language Fields for Efficient 3D Visual Question Answering

    Sep 14, 2026Davit Soselia, Joseph JaJa, Amitabh Varshney3DGS CompressionLanguage-Embedded 3DGS

  8. MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT

    Sep 3, 2026Chenguang Zheng, Le Xue, Yichi Zhang +8PET/CT ImagingMedical VLMs

  9. Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

    Aug 4, 2026Lucy Lin, Ayush Jain, Yifan Liu +13D Foundation Models3D VQA

  10. 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

    Aug 2, 2026Changwoo Baek, Kyeongbo KongMultimodal Token Compression3D VQA

  11. Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

    Jul 5, 2026Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu +2Efficient VLM InferenceMultimodal QA

  12. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +1Visual Question AnsweringActive Perception

  13. Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

    Jun 18, 2026Jianing Li, Zhou Fang, Yijiang Liu +13D Occupancy Prediction3D VQA

  14. Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

    Jun 5, 2026Hanxun Yu, Xuan Qu, Lei Ke +43D Spatial Reasoning3D VQA

  15. PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding

    Jun 4, 2026Shaohui Dai, Yansong Qu, You Shen +23D Part Segmentation3D Representation Learning

  16. Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation

    Jun 2, 2026Dongsheng Wang, Dawei Su, Hui Huang3D VQAVisual Token Compression

  17. NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

    May 19, 2026Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh +12Healthcare3D Medical Imaging

  18. SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning

    May 18, 2026Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su +1Visual Spatial Reasoning3D Spatial Reasoning

  19. Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

    May 8, 2026Jerry Jiang, Haowen Sun, Denis Gudovskiy +43D Spatial Reasoning3D Representation Learning