3D VLMs

VLM: Vision-Language Model

Momentum

14 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 118

All topics
CardsList
  1. SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning

    Oct 6, 2026Hairong Yin, Huangying Zhan, Shin-Fang Chng +2Vision-Language ModelsSpatiotemporal Reasoning

  2. Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment

    Oct 6, 2026Maryam Baizhigitova, Andrew Seohwan Yu, Po-Hao Chen +7Medical ImagingMedical Image Analysis

  3. Lens3D: Target-Conditioned Visual Foveation for Fine-Grained 3D Understanding

    Oct 5, 2026Junming Huang, Zini Chen, Shuaiying Hou +3Active View Selection3D VQA

  4. Render to Reason: Novel-View Semantic Prediction Improves Spatial Understanding in VLMs

    Oct 4, 2026Yuqun Wu, Yao Xiao, Chuhang Zou +2Visual Spatial Reasoning3D VQA

  5. GeoLatent: Geometry-Guided Latent Structuring with Routed Optimization for 3D Reasoning

    Oct 1, 2026Yakun Zhu, Yi Bin, Yujuan Ding +53D Spatial ReasoningGeometric Representation Learning

  6. Task-Adaptive Grounded 3D-Programmers Using 2D VLMs

    Oct 1, 2026Arman Raayatsanati, Sombit Dey, Anna-Maria Halacheva +33D Scene Generation3D Scene Understanding

  7. Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

    Sep 29, 2026Jaewoo Jung, Hyeonseo Yu, Honggyu An +103D Spatial Reasoning3D Scene Representation

  8. SceneScaffold: Active Scene-State Construction for Unified 3D Scene Understanding

    Sep 27, 2026Xiangqi Li, Libo Huang, Jiarui Zhao +43D Scene Representation3D VQA

  9. Retrieve-to-Localize: Bridging Large Language Models and LiDAR Geometry for Spatial Grounding

    Sep 24, 2026Byounggun Park, Giyong Moon, Jusung Kim +13D Spatial Reasoning3D VLMs

  10. From Alignment to Fusion in 3D Vision-Language

    Sep 23, 2026Xueqi Qiu, Xingyu Miao, Jingjing Deng +33D Representation LearningVision-Language Alignment

  11. NV-Reason-CT: 3D Visual Language Model for CT Analysis

    Sep 23, 2026Andriy Myronenko, Dong Yang, Yucheng Tang +13Radiology Report GenerationRadiology VLMs

  12. Hybrid Gaussians for Robust Open-Vocabulary 3D Segmentation with Multi-View Object Association and Boundary Refinement

    Sep 23, 2026Xueqi Qiu, Yueming Sun, Tianyu Zhang +2Language-Embedded 3DGSOpen-Vocabulary 3D Segmentation

  13. Do LiDAR Language Models Really Understand Spatio-temporal Relationships?

    Sep 21, 2026Runyi Yang, Murat Akkoyun, Di Wen +8VLM EvaluationHallucination Detection in VLMs

  14. SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes

    Sep 14, 2026Anubhav Khanal, Prabigya Acharya, Roshni Poudel +5Spatial Reasoning Benchmarks3D Spatial Reasoning

  15. LangStreet: Persistent Language Fields for Anchor-Decoded Street Gaussians

    Sep 11, 2026Runyi Yang, Deheng Zhang, Xiaoye Wang +63D Gaussian SplattingLanguage-Embedded 3DGS

  16. CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs

    Sep 8, 2026Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu +73D Spatial ReasoningVisual Token Pruning

  17. CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

    Aug 13, 2026Peng Ling, Yingda Yin, Lingting Zhu +53D Spatial ReasoningVisual Token Pruning

  18. ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes

    Aug 11, 2026Xinrui Lin, Sha Zhang, Shumin Wang +33D Scene Understanding3D VLMs

  19. Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

    Aug 10, 2026Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian +4Geometric Representation LearningVision-Language Grounding

  20. RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

    Aug 10, 2026Zhihao Zhang, Gengwei Zhang, Tianlong Chen +13D Object DetectionMonocular 3D Object Detection

  21. From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

    Aug 9, 2026Alexander Hackett, Arnaud Denis-Remillard, Axel CassouVLM InterpretabilityVision-Language-Action Models

  22. OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

    Aug 6, 2026Taiting Lu, Runze Liu, Ziwei Dong +18Manufacturing3D Reconstruction

  23. HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

    Aug 5, 2026Jiuhe Qu, Yingping Liang, Ying Fu3D Spatial ReasoningVisual Token Pruning

  24. Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

    Aug 5, 2026Runwei Guan, Di Tian, Ningwei Ouyang +9Autonomous Driving DatasetsVLMs for Autonomous Driving

  25. Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

    Aug 4, 2026Jiaju Han, Xuemeng Sun, Qike Zhang +6VLMs for Autonomous DrivingMillimeter-Wave Radar

  26. Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

    Aug 4, 2026Jialu Huang, Yingxuan You, Fei Wang +13D Scene Generation3D Scene Representation