3D Scene Understanding

Momentum

27 papers in the last four weeks, up 200% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 188

All topics
CardsList
  1. Learning Representations from 3D Gaussian Splats

    May 28, 2026Julia Farganus, Krzysztof Żurawicki, Arkadiusz Gaweł +23D Gaussian SplattingGeometric Representation Learning

  2. ESAM++: Efficient Online 3D Perception on the Edge

    May 28, 2026Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay +4Edge InferencePoint Cloud Learning

  3. 3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding

    May 28, 2026Zhongyu Xia, Yousen Tang, Bingqing Wei +13D Spatial ReasoningRobotic Manipulation

  4. Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

    May 27, 2026Yang Gao, Wuyang Li, Po-Chien Luan +13D Gaussian SplattingAutonomous Driving Perception

  5. Joint 2D-3D Segmentation and Association in Street-level Imaging

    May 26, 2026Amir Melnikov, Masayuki Tanaka, Yusuke Monno +13D Semantic Segmentation3D Scene Understanding

  6. Uncertainty-Aware Gaussian Map for Vision-Language Navigation

    May 26, 2026Jianzhe Gao, Rui Liu, Yuxuan Xu +6Uncertainty Estimation for VLA ModelsVision-Language Navigation

  7. 3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation

    May 26, 2026Jianzhe Gao, Rui Liu, Wenguan WangVision-Language Navigation3D Scene Representation

  8. Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

    May 25, 2026Junwei Zhou, Yu-Wing Tai3D Spatial Reasoning3D Scene Layout Generation

  9. Unified 3D Scene Understanding Through Physical World Modeling

    May 23, 2026Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh +4Unified Multimodal ModelsDepth Estimation

  10. GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer

    May 22, 2026Diogo Lavado, Alessandra Micheletti, Clàudia Soares3D Semantic SegmentationGeometric Representation Learning

  11. PhotoFlow: Agentic 3D Virtual Photography Missions

    May 22, 2026Jiarui Guo, Haojia Wei, Yiming Zhang +5Tool-Using Vision-Language Agents3D Scene Understanding

  12. LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

    May 22, 2026Yilong Liu, Wanhua Li, Chen Zhu-Tian +13D Gaussian SplattingLanguage-Embedded 3DGS

  13. DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

    May 22, 2026Hao Vo, Khoa Vo, Phu Loc Nguyen +10VLM EvaluationAutonomous Driving Datasets

  14. EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control

    May 21, 2026Chushan Zhang, Ruihan Lu, Jinguang Tong +3World Models for RoboticsVision-Language-Action Models

  15. Mono-Hydra++: Real-Time Monocular Scene Graph Construction with Multi-Task Learning for 3D Indoor Mapping

    May 17, 2026U. V. B. L. Udugama, George Vosselman, Francesco Nex3D SGGVisual-Inertial SLAM

  16. Unlocking Dense Metric Depth Estimation in VLMs

    May 15, 2026Hanxun Yu, Xuan Qu, Yuxin Wang +2Vision-Language ModelsMetric Depth Estimation

  17. WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

    May 15, 2026Jichen Hu, Jiawei Guo, Jiazhong Cen +33D Scene EditingInteractive World Models

  18. Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

    May 15, 2026Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas +43D SGG3D Scene Understanding

  19. 3D Segmentation Using Viewpoint-Dependent Spatial Relationships

    May 15, 2026Ayaka Nanri, Klara Reichard, Mert Kiray +33D Spatial Reasoning3D Scene Understanding

  20. Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

    May 14, 2026Ziyi Xia, Chaoran Xiong, Litao Wei +2Vision-Language Navigation3D Scene Understanding

  21. PanoWorld: Towards Spatial Supersensing in 360∘^\circ Panorama World

    May 13, 2026Changpeng Wang, Xin Lin, Junhan Liu +53D Spatial Reasoning3D Scene Understanding

  22. OpenSGA: Efficient 3D Scene Graph Alignment in the Open World

    May 11, 2026Gang Chen, Sebastián Barbas Laina, Stefan Leutenegger +1Robot Localization3D Scene Understanding

  23. MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

    May 11, 2026Guangli Chen, Dianzhao Li, Wenjian Zhong +2Camera-LiDAR FusionRL for Autonomous Driving

  24. Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

    May 10, 2026Alaa Asfour, Christopher Indris, Leihan Chen +2Cross-Modal Knowledge Distillation3D Spatial Reasoning

  25. Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

    May 9, 2026Sagar Bharadwaj, Ziyong Ma, Anurag Ghosh +2Tool Use in VLMs3D Spatial Reasoning