3D Scene Understanding

Momentum

27 papers in the last four weeks, up 200% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 188

All topics
CardsList
  1. Engine-Native Editable 3D World Reconstruction with Objects and Lighting

    Jul 23, 2026Junhao Chen, Xinghao Chen, Henghaofan Zhang +83D Reconstruction3D Object Detection

  2. Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

    Jul 22, 2026Kwonyoung Ryu, In-Jae Lee, Jonghyun Jin +3Panoptic SegmentationMulti-View Learning

  3. IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

    Jul 21, 2026Zhengyu Zou, Hao Li, Kuixuan Jiao +73D ViTsStreaming 3D Reconstruction

  4. MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction

    Jul 17, 2026Homanga Bharadhwaj, Yash JangirTrajectory Prediction3D Scene Understanding

  5. OASIS-Map: Object-Level Change Detection in Multi-Session Mapping using Semantic Correspondence Matching

    Jul 16, 2026Haedam Oh, Yifu Tao, Nived Chebrolu +1Semantic CorrespondenceSemantic Change Detection

  6. SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

    Jul 16, 2026Yi Wu, Junjie An, Xiao Liu +6Vision-Language ModelsEmbodied Navigation

  7. GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

    Jul 15, 2026Hao Li, Han Fang, Zixin Pan +83D Spatial ReasoningLatent Visual Reasoning

  8. CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding

    Jul 11, 2026Yuang Jia, Jinlong Wang, Junhong Lin +23DGS CompressionEntropy Coding

  9. Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation

    Jul 10, 2026Hyungtae Lim, Nathan Hughes, Xihang Yu +5Streaming 3D Reconstruction3D Reconstruction

  10. AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration

    Jul 10, 2026Timofei Kozlov, Dmitrii Maliukov, Andrey Marchenko +23D Gaussian SplattingStreaming 3D Reconstruction

  11. MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

    Jul 9, 2026Hantao Zhang, Jinru Sui, Ed Li +2VLM EvaluationVision-Language Models

  12. PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation

    Jul 8, 2026Yi Yang, Myrna Castillo, Bodo Rosenhahn +13D SGG3D Scene Understanding

  13. CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

    Jul 7, 2026He Liang, Chenyang Ma, Yiming Zhang +43D Spatial Reasoning3D Scene Understanding

  14. PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

    Jul 7, 2026Xiaopei Wu, Chenshu Hou, Liang Peng +93D Scene Understanding3D VLMs

  15. Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

    Jul 6, 2026Xianhao Chen, Jiarui Hu, Yuanbo Yang +5Graph Attention NetworksOpen-Vocabulary 3D Segmentation

  16. Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

    Jul 5, 2026Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu +2Efficient VLM InferenceMultimodal QA

  17. IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

    Jul 3, 2026Yuening Cai, Junwei Zhou, Youran Qu +1VLM EvaluationSpatial Reasoning Benchmarks

  18. Holo-Captioning: Toward the Text Equivalent of 3D Scenes

    Jul 3, 2026Kun-Yu Lin, Chengke Bu, Zhenguo Li +13D SGG3D Scene Understanding

  19. VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

    Jul 2, 2026Marwane Hariat, David Filliat, Antoine ManzaneraOpen-Vocabulary 3D SegmentationFeed-Forward 3D Reconstruction

  20. Consistent Scene Understanding in 3D Gaussian Splatting via Multi-Cue Mask Refinement

    Jul 2, 2026Hyunjoon Park, Donghyeon ChoMulti-View Consistency3D Gaussian Splatting

  21. Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images

    Jul 2, 2026Hu Zhu, Bohan Li, Xianda Guo +53D Gaussian SplattingOpen-Vocabulary 3D Segmentation

  22. Structured 4D Latent Predictive Model for Robot Planning

    Jul 1, 2026Zhiyi Li, Peilin Wu, Xiaoshen Han +2Long-Horizon Robotic ManipulationWorld Models for Robotics

  23. DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

    Jul 1, 2026Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha +4Scene Graph Generation3D SGG

  24. OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

    Jun 29, 2026Yirum Kim, Ue-Hwan Kim3D SGGRobotic Perception

  25. VCS-SLAM: Geometry-Validated Semantic Evidence Fusion for 3D Gaussian SLAM

    Jun 28, 2026Raman Jha, Shuaihang Yuan, Yi Fang3D Gaussian Splatting3DGS SLAM

  26. Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling

    Jun 26, 2026Qinfeng Zhu, Lei FanVision Foundation Models3D Scene Understanding

  27. Learning 3D Affordances for Blade Insertion in Cluttered Stowing

    Jun 25, 2026Tianyu Li, Harpreet Sawhney, Minju Jung +3Robotic Insertion3D Occupancy Prediction

  28. Perceptual 3D Simulation With Physical World Modeling

    Jun 25, 2026Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh +2World Model LearningWorld Models

  29. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

    Jun 24, 2026Yu-Yang Chen, Lan-Zhe GuoSpatial Reasoning BenchmarksVisual Reasoning