3D VLMs

VLM: Vision-Language Model

Momentum

14 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 118

All topics
CardsList
  1. Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

    Aug 4, 2026Lucy Lin, Ayush Jain, Yifan Liu +13D Foundation Models3D VQA

  2. 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

    Aug 2, 2026Changwoo Baek, Kyeongbo KongMultimodal Token Compression3D VQA

  3. Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

    Jul 31, 2026Yanbin Hu, Jin Cui, Jun Ye +43D Spatial ReasoningVLM Distillation

  4. MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

    Jul 29, 2026Yitao Zhu, Mengjun Liu, Yingji Fu +2Efficient VLM InferenceMedical VLMs

  5. ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

    Jul 27, 2026Hangjie Yuan, Yichen Qian, Zhiwei Tang +21Medical Report GenerationMedical VQA

  6. RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

    Jul 24, 2026Jianqin Liu, Weiwei Cao, Wanxing Chang +7Radiology VLMsMedical Image Grounding

  7. Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models

    Jul 24, 2026Renjie LiangVLM EvaluationMedical VLMs

  8. 3D-Aware VLMs with Implicit and Explicit Geometries

    Jul 23, 2026Wenhao Li, Xueying Jiang, Quanhao Qian +43D Spatial Reasoning3D Object Detection

  9. D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

    Jul 21, 2026Heesang Han, A. Lynn Abbott, Abhijit SarkarVLMs for Autonomous DrivingCamera-LiDAR Fusion

  10. When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?

    Jul 17, 2026Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He +1Zero-Shot LearningRadiology VLMs

  11. Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

    Jul 16, 2026Sinyoung Ra, Jonghun Kim, Hyunjin ParkRadiology Report Generation3D Medical Imaging

  12. GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

    Jul 15, 2026Hao Li, Han Fang, Zixin Pan +83D Spatial ReasoningLatent Visual Reasoning

  13. CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding

    Jul 11, 2026Yuang Jia, Jinlong Wang, Junhong Lin +23DGS CompressionEntropy Coding

  14. ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

    Jul 7, 2026Tianjiao Yu, Xinzhuo Li, Yifan Shen +43D Foundation ModelsUnified Multimodal Models

  15. CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

    Jul 7, 2026He Liang, Chenyang Ma, Yiming Zhang +43D Spatial Reasoning3D Scene Understanding

  16. VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

    Jul 7, 2026Jiazi Wang, Nonghai Zhang, Qiushi Xie +5Multimodal RAGCultural Heritage

  17. PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

    Jul 7, 2026Xiaopei Wu, Chenshu Hou, Liang Peng +93D Scene Understanding3D VLMs

  18. SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

    Jul 7, 2026Haida Feng, Hao Wei, Haolin Wang +33D Spatial ReasoningMixture of Experts

  19. Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

    Jul 6, 2026Amol Harsh, Zongyan Han, Jean Lahoud +53D Spatial ReasoningMultimodal QA

  20. G2^2TAM: Geometry Grounded Track Anything Model

    Jul 4, 2026Chenming Zhu, Peizhou Cao, Jingli Lin +5Video Object Segmentation3D Reconstruction

  21. From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

    Jul 4, 2026Shuju Jing, Chao YinPoint Cloud Understanding3D VLMs

  22. SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video

    Jul 2, 2026Weili Guan, Haoyu Zhang, Meng Liu +3Visual Spatial Reasoning3D Spatial Reasoning

  23. Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

    Jul 1, 2026Yiqian Liu, Iuliia Kotseruba, John K. TsotsosVLM EvaluationVision-Language Models

  24. MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

    Jun 30, 2026Kartik Bali, Roland AydinOpen-Vocabulary 3D Segmentation3D VLMs

  25. PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

    Jun 30, 2026Duc Cao Dinh, Khai Le-Duc, Florent Draye +43D Spatial ReasoningVisually Grounded Reasoning

  26. Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

    Jun 24, 2026Bowen Shi, Weiwei Cao, Ruifeng Yuan +5Contrastive Learning3D Medical Imaging

  27. Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

    Jun 23, 2026Julien Khlaut, Charles Corbière, Baptiste Callard +93D Foundation ModelsMedical Imaging Foundation Models