3D VLMs

VLM: Vision-Language Model

Momentum

14 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 118

All topics
CardsList
  1. Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

    Jun 19, 2026Marwane Hariat, Gianni Franchi, David Filliat +1Multi-View ConsistencyBayesian Inference

  2. SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

    Jun 18, 2026Jiayu Tang, Yuchen Zhou, Chao Gou3D Spatial ReasoningVLM Interpretability

  3. 3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

    Jun 18, 2026Jintang Xue, Xinyu Wang, Yixing Wu +23D Representation LearningMultimodal Foundation Models

  4. Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

    Jun 18, 2026Jianing Li, Zhou Fang, Yijiang Liu +13D Occupancy Prediction3D VQA

  5. OneCanvas: 3D Scene Understanding via Panoramic Reprojection

    Jun 17, 2026Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner3D Spatial ReasoningEmbodied QA

  6. Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

    Jun 16, 2026Sneha Paul, Zachary Patterson, Nizar BouguilaMultimodal RobustnessVLM Adaptation

  7. Segment and Select: Vision-Language Segmentation in 3D Scenarios

    Jun 9, 2026Yulin Chen, Zhihang Zhong, Yuenan Hou3D Point Cloud SegmentationReferring Expression Segmentation

  8. 3D-CoS: A New 3D Reconstruction Paradigm Based on VLM Code Synthesis

    Jun 9, 2026Yuhao Wang, Puyi Wang, Linjie Li +33D Asset Generation3D Scene Editing

  9. DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

    Jun 8, 2026Nanshan Jia, Zhenyu Zhao, Junbo Peng +3VLM Evaluation3D VLMs

  10. Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

    Jun 5, 2026Hanxun Yu, Xuan Qu, Lei Ke +43D Spatial Reasoning3D VQA

  11. PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding

    Jun 4, 2026Shaohui Dai, Yansong Qu, You Shen +23D Part Segmentation3D Representation Learning

  12. BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

    Jun 3, 2026Muhammad Usama, Didier Stricker, Mohammad Sadil Khan +1Multimodal PretrainingMultimodal Contrastive Learning

  13. HOLA: Holistic Multi-Modal Alignment for Open-Set 3D Recognition

    May 31, 2026Koby Aharonov, Oren Shrout, Ayellet TalContrastive LearningOpen-Set Recognition

  14. Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

    May 31, 2026Wentao Mo, Yang LiuCoT Distillation3D Spatial Reasoning

  15. VLM3: Vision Language Models Are Native 3D Learners

    May 28, 2026Zhipeng Cai, Zhuang Liu, Yunyang Xiong +3Camera Pose EstimationMonocular Depth Estimation

  16. Grounded 3D-Aware Spatial Vision-Language Modeling

    May 28, 2026An-Chieh Cheng, Yang Fu, Yatai Ji +123D Spatial ReasoningVisually Grounded Reasoning

  17. Planning with the Views

    May 28, 2026Kangrui Wang, Linjie Li, Zhengyuan Yang +7Next-Best-View PlanningRL for VLMs

  18. SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

    May 27, 2026Jiawei Li, Ziyi Liu, Weijie Shi +33D Spatial ReasoningLatent Visual Reasoning

  19. PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment

    May 27, 2026Duanchu Wang, Cheng Li, Junjie Yang +5VLM EvaluationPoint Cloud Understanding

  20. TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting

    May 26, 2026Yuyang Tan, Renhe Zhang, Hang Zhang +2Multi-View Consistency3D Gaussian Splatting

  21. PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought

    May 21, 2026Chaoqi Chen, Qile Xu, Wenjun Zhou +1CoT ReasoningPoint Cloud Understanding

  22. PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects

    May 20, 2026Ziang Cao, Yinghao Liu, Haitian Li +53D Asset GenerationPhysics-Based Simulation

  23. CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

    May 19, 2026Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen +3VLM Evaluation3D Spatial Reasoning

  24. Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence

    May 19, 2026Zebin He, Mingxin Yang, Shuhui Yang +43D Foundation ModelsCross-Modal Alignment

  25. Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

    May 19, 2026Xueying Jiang, Wenhao Li, Quanhao Qian +43D Object Detection3D VLMs

  26. 3D Segmentation Using Viewpoint-Dependent Spatial Relationships

    May 15, 2026Ayaka Nanri, Klara Reichard, Mert Kiray +33D Spatial Reasoning3D Scene Understanding

  27. PanoWorld: Towards Spatial Supersensing in 360∘^\circ Panorama World

    May 13, 2026Changpeng Wang, Xin Lin, Junhan Liu +53D Spatial Reasoning3D Scene Understanding

  28. Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

    May 10, 2026Alaa Asfour, Christopher Indris, Leihan Chen +2Cross-Modal Knowledge Distillation3D Spatial Reasoning