3D Scene Understanding

Momentum

27 papers in the last four weeks, up 200% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 188

All topics
CardsList
  1. From Pixels to Primitives: Scene Change Detection in 3D Gaussian Splatting

    May 8, 2026Chamuditha Jayanga Galappaththige, Jason Lai, Timothy Patten +33D Gaussian Splatting3D Scene Representation

  2. OpenGaFF: Open-Vocabulary Gaussian Feature Field with Codebook Attention

    May 7, 2026Kunyi Li, Michael Niemeyer, Sen Wang +33D Gaussian SplattingOpen-Vocabulary 3D Segmentation

  3. Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

    May 6, 2026Binh Long Nguyen, Kien Nguyen, Sridha Sridharan +23D Gaussian SplattingLanguage-Embedded 3DGS

  4. FUS3DMaps: Scalable and Accurate Open-Vocabulary Semantic Mapping by 3D Fusion of Voxel- and Instance-Level Layers

    May 5, 2026Timon Homberger, Finn Lukas Busch, Jesús Gerardo Ortega Peimbert +2Open-Vocabulary 3D Segmentation3D Semantic Segmentation

  5. Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning

    May 3, 2026Sixian Zhang, Yiyao Wang, Xinhang Song +3Embodied Navigation3D Scene Representation

  6. VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

    May 2, 2026Haowen Sun, Shaolong Zhang, Mingyang Li +63D Point Cloud Segmentation3D Scene Understanding

  7. HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

    Apr 30, 2026Xin Zhou, Dingkang Liang, Xiwu Chen +4World Model Learning3D Scene Generation

  8. Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

    Apr 29, 2026Nikita Araslanov, Martin Sundermeyer, Hidenobu Matsuki +2Video Representation Learning3D Scene Understanding

  9. Semantic Foam: Unifying Spatial and Semantic Scene Decomposition

    Apr 29, 2026Amr Sharafeldin, Shrisudhan Govindarajan, Thomas Walker +43D Semantic Segmentation3D Scene Representation

  10. ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

    Apr 27, 2026Yiming Zhang, Jiacheng Chen, Jiaqi Tan +3VLM EvaluationSpatial Reasoning Benchmarks

  11. INSIGHT: Indoor Scene Intelligence from Geometric-Semantic Hierarchy Transfer for Public~Safety

    Apr 25, 2026Alexander Nikitas Dimopoulos, Joseph Grasso, John Beltz3D Semantic Segmentation3D Scene Representation

  12. ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild

    Apr 24, 2026Hanyu Chen, Ruojin Cai, Steve Marschner +13D Scene Understanding

  13. Seeing Without Eyes: 4D Human-Scene Understanding from Wearable IMUs

    Apr 23, 2026Hao-Yu Hsu, Tianhang Cheng, Jing Wen +24D ReconstructionWearable Sensing

  14. Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding

    Apr 21, 2026Kadir Yilmaz, Adrian Kruse, Tristan Höfer +23D ViTs3D Semantic Segmentation

  15. Feasibility of Indoor Frame-Wise Lidar Semantic Segmentation via Distillation from Visual Foundation Model

    Apr 20, 2026Haiyang Wu, Juan J. Gonzales Torres, George Vosselman +1Cross-Modal Knowledge DistillationVision Foundation Model Adaptation

  16. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

    Apr 20, 2026Han Li, Zehao Huang, Jiahui Fu +2Visual Token PruningVisual Token Compression

  17. PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding

    Apr 17, 2026Junjie Wen, Junlin He, Fei Ma +13D Scene Representation3D Representation Learning

  18. GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

    Apr 12, 2026Nicolae Cudlenco, Mihai Masala, Marius LeordeanuSynthetic Data GenerationVideo Representation Learning

  19. RGB-Pointmap Pretraining for Unified 3D Scene Understanding

    Apr 2, 2026Ye Mao, Weixun Luo, Ranran Huang +23D Foundation ModelsMulti-View Learning

  20. LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

    Apr 1, 2026Fusang Wang, Nathan Piasco, Moussab Bennehar +3Point Cloud Understanding3D Scene Understanding

  21. SceneTeract: Probing and Improving Agent-Aware Activity Reasoning in 3D Indoor Scenes

    Mar 31, 2026Léopold Maillard, Francis Engelmann, Tom Durand +43D Spatial ReasoningEmbodied AI

  22. UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Affordance Segmentation

    Mar 24, 2026Jiaying Lin, Dan Xu3D Scene Understanding3D Visual Grounding

  23. Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

    Mar 19, 2026Xianjin Wu, Dingkang Liang, Tianrui Feng +53D Spatial Reasoning3D Scene Understanding

  24. O3N: Omnidirectional Open-Vocabulary Occupancy Prediction

    Mar 12, 2026Mengfei Duan, Hao Shi, Fei Teng +43D Occupancy Prediction3D Scene Understanding

  25. PanoAffordanceNet: Towards Holistic Affordance Grounding in 360° Indoor Environments

    Mar 10, 2026Guoliang Zhu, Wanjun Jia, Caoyang Shao +3Embodied AI3D Scene Understanding

  26. X-GS: An Extensible Framework for Perceiving and Thinking with 3D Gaussian Splatting

    Mar 10, 2026Yueen Ma, Zenglin Xu, Irwin King3D Gaussian Splatting3DGS SLAM

  27. I-Perceive: A Foundation Model for Vision-Language Active Perception

    Feb 28, 2026Yongxi Huang, Zhuohang Wang, Wenjing Tang +3Active PerceptionRobot Foundation Models

  28. StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation

    Feb 27, 2026Jiasong Xiao, Yutao She, Kai Li +2Long-Horizon Robotic ManipulationWorld Models for Robotics