3D VLMs

VLM: Vision-Language Model

Momentum

14 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 118

All topics
CardsList
  1. Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

    May 8, 2026Jerry Jiang, Haowen Sun, Denis Gudovskiy +43D Spatial Reasoning3D Representation Learning

  2. Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

    May 8, 2026Haoming Wang, Wei GaoVisual Spatial ReasoningVLM Interpretability

  3. VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

    May 2, 2026Haowen Sun, Shaolong Zhang, Mingyang Li +63D Point Cloud Segmentation3D Scene Understanding

  4. Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

    Apr 29, 2026Yufei Yin, Jie Zheng, Qianke Meng +73D VLMs3D Visual Grounding

  5. Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

    Apr 23, 2026Jingkun Chen, Ruoshi Xu, Mingqi Gao +23D Spatial ReasoningVLM Hallucination

  6. CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

    Apr 21, 2026Shengli Zhou, Xiangchen Wang, Guanhua Chen +13D Spatial ReasoningVLM Reasoning

  7. XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

    Apr 20, 2026Kangan Qian, ChuChu Xie, Yang Zhong +133D Spatial ReasoningEmbodied QA

  8. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

    Apr 20, 2026Han Li, Zehao Huang, Jiahui Fu +2Visual Token PruningVisual Token Compression

  9. Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning

    Apr 20, 2026Xixi Liu, Jorge Lazo, Andreas Hallqvist +8Clinical Outcome PredictionMedical VLMs

  10. E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes

    Apr 20, 2026Koya Sakamoto, Taiki Miyanishi, Daichi Azuma +6Active PerceptionNext-Best-View Planning

  11. P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models

    Apr 17, 2026Geunyoung Jung, Soohong Kim, Kyungwoo Song +1Point Cloud ClassificationVLM Adaptation

  12. RGB-Pointmap Pretraining for Unified 3D Scene Understanding

    Apr 2, 2026Ye Mao, Weixun Luo, Ranran Huang +23D Foundation ModelsMulti-View Learning

  13. LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

    Apr 1, 2026Fusang Wang, Nathan Piasco, Moussab Bennehar +3Point Cloud Understanding3D Scene Understanding

  14. SceneTeract: Probing and Improving Agent-Aware Activity Reasoning in 3D Indoor Scenes

    Mar 31, 2026Léopold Maillard, Francis Engelmann, Tom Durand +43D Spatial ReasoningEmbodied AI

  15. TSegAgent: Zero-Shot Tooth Segmentation via Geometry-Aware Vision-Language Agents

    Mar 20, 2026Shaojie Zhuang, Lu Yin, Guangshun Wei +3Medical ImagingMedical Image Segmentation

  16. Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

    Mar 19, 2026Xianjin Wu, Dingkang Liang, Tianrui Feng +53D Spatial Reasoning3D Scene Understanding

  17. X-GS: An Extensible Framework for Perceiving and Thinking with 3D Gaussian Splatting

    Mar 10, 2026Yueen Ma, Zenglin Xu, Irwin King3D Gaussian Splatting3DGS SLAM

  18. JOPP-3D: Joint Open Vocabulary Semantic Segmentation on Point Clouds and Panoramas

    Mar 6, 2026Sandeep Inuganti, Hideaki Kanayama, Kanta Shimizu +43D Point Cloud SegmentationOpen-Vocabulary 3D Segmentation

  19. TotalFM: An Organ-Separated 3D-CT Foundation Model Leveraging Large-Scale Routine Clinical Radiology Data

    Jan 1, 2026Kohei Yamamoto, Tomohiro Kikuchi3D Foundation ModelsMedical Imaging Foundation Models

  20. OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding

    Dec 28, 2025Wenyuan Huang, Zhenyu Zhang, Zhao Wang +43D VLMs3D Visual Grounding

  21. BrepLLM: Enabling Large Language Models to Understand Boundary Representations

    Dec 18, 2025Liyuan Deng, Hao Guo, Yongkang Dai +5Multimodal Large Language Models3D Representation Learning

  22. Think, Then Look: Active Spatial Reasoning for House-Scale 3D Scene Understanding

    Dec 2, 2025Hongpei Zheng, Shijie Li, Lin Qian +4Spatial Reasoning Benchmarks3D Spatial Reasoning

  23. Error-Driven Scene Editing for 3D Grounding in Large Language Models

    Nov 18, 2025Yue Zhang, Zun Wang, Han Lin +53D Scene Editing3D Spatial Reasoning

  24. VLEM: Real-Time 3D Vision-Language Embedding Mapping

    Aug 8, 2025Christian Rauch, Björn Ellensohn, Linus Nwankwo +2Open-Vocabulary 3D Segmentation3D Scene Representation

  25. Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

    Jul 29, 2025Ziren Gong, Xiaohan Li, Fabio Tosi +4Open-Vocabulary 3D Segmentation3D Reconstruction

  26. From Alignment to Synthesis: Contrastive Volumetric Grounding for Text-to-CT Generation

    May 31, 2025Daniele Molino, Camillo Maria Caruso, Filippo Ruffini +2Latent Diffusion ModelsMedical Image Synthesis

  27. 3D-MoE: Towards Spatial Intelligence with Mixture-of-Experts for 3D Reasoning and Action Generation

    Jan 28, 2025Yueen Ma, Zenglin Xu, Irwin King3D Spatial ReasoningMixture-of-Experts Inference