3D Scene Understanding

Momentum

12 papers in the last four weeks, up 300% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 115

All topics
CardsList
  1. Task-Adaptive Grounded 3D-Programmers Using 2D VLMs

    Oct 1, 2026Arman Raayatsanati, Sombit Dey, Anna-Maria Halacheva +33D Visual Grounding3D Scene Understanding

  2. GenCOPE: Syn2Real Generalized Category-Level Object Pose Estimation for Robotic Picking

    Oct 1, 2026Jian Liu, Wei Sun, Zhenqi Dai +4Category-Level Object Pose EstimationSynthetic-To-Real Domain Gap

  3. EviSplat: Preserving Multi-View Evidence in 3D Gaussian Splatting for Open-Vocabulary Segmentation

    Sep 28, 2026Sungho Moon, Kota Shimomura, Junwoo Park +4Open-Vocabulary 3D Segmentation3D Scene Understanding

  4. SceneScaffold: Active Scene-State Construction for Unified 3D Scene Understanding

    Sep 27, 2026Xiangqi Li, Libo Huang, Jiarui Zhao +43D Scene UnderstandingState-Tracking

  5. TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

    Sep 24, 2026Ayush Jain, Sreeharsha Paruchuri, Ishita Gupta +53D Tracking3D Scene Understanding

  6. OREN-X: Octree Residual Network for Real-Time Multi-Modal Mapping

    Sep 24, 2026Zhirui Dai, Qihao Qian, Dinh Minh Nguyen +63D MappingSimultaneous Localization And Mapping

  7. PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

    Sep 16, 2026Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung +53D Tracking3D Scene Understanding

  8. Partition-Invariant Tuning for 3D Scene Understanding

    Sep 14, 2026Hongqiang Lin, Tianle Wang, Shuiwang Li +4Point Clouds3D Scene Understanding

  9. What Makes a 3D Scene Editable? A Factorized Benchmark of Fidelity, Locality, Consistency, and Preservation

    Sep 14, 2026Sariah Patro, Arjun Mehra, Nikhil Bhatia3D Editing3D Scene Understanding

  10. GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting

    Sep 8, 2026Thodoris Betsas, Anastasios Doulamis, Andreas Georgopoulos3D Scene UnderstandingVisual Embeddings

  11. Spheriverse: 3D Scene Understanding from Spherical Observations in the Wild

    Sep 8, 2026Fei Teng, Sheng Wu, Mengfei Duan +73D Semantic Occupancy Prediction3D Scene Understanding

  12. ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

    Aug 31, 2026Jiawei Zhang, Hongsong Wang, Pan Zhou3D Scene GenerationIndoor Scene Generation

  13. CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

    Aug 11, 2026Haeyun Choi, Minhyuk Jang, I-Gil KimNovel View Synthesis3D Gaussian

  14. OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Prediction

    Aug 9, 2026Junjie Liu, Wanshui Gan, Zitong Dai +63D Semantic Occupancy Prediction3D Scene Understanding

  15. Rethinking 3D Segmentation from Individual LiDAR Scans: Incidence-Aware Sampling on the SIP Benchmark

    Aug 7, 2026Seongyong Kim, Jingdao Chen, Yong Kwon ChoInteractive 3D SegmentationPoint Clouds

  16. InstanceSplat: Instance-Aware Feed-Forward 3D Gaussian Splatting for Scene Understanding

    Aug 7, 2026Minchao Jiang, Xiaoxuan Ma, Shunyu Jia +3Feed-Forward 3D Gaussian Splatting3D Scene Understanding

  17. SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

    Aug 5, 2026Yue Zhang, Yingzhao Jian, Yunqiu Xu +23D Scene UnderstandingMultimodal Reasoning

  18. WorldClaw: Agentic 3D Open-World Generation at Scale

    Aug 5, 2026Chunchao Guo, Jinpeng Li, Yang Li +13D World3D Scene Understanding

  19. HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

    Aug 5, 2026Jiuhe Qu, Yingping Liang, Ying Fu3D Scene UnderstandingToken Compression

  20. OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes

    Aug 5, 2026Xia Yan, He Wu, Yanghui Xu +23D Scene UnderstandingObject Localization

  21. Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

    Aug 4, 2026Jialu Huang, Yingxuan You, Fei Wang +13D Scene Generation3D Scene Understanding

  22. Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

    Aug 2, 2026Robin Kim, Colin Samplawski, Benjamin M. Marlin3D Object DetectionDetection Transformer

  23. Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

    Jul 31, 2026Yanbin Hu, Jin Cui, Jun Ye +43D Scene UnderstandingRed-Green-Blue

  24. MonoVoc: Decoupling Geometry and Semantics for Lightweight Monocular Open-Vocabulary 3D Gaussians

    Jul 30, 2026Pouya Ardekhani, Zahra Dehghanian, Morteza Abolghasemi +13D Scene Understanding3D Gaussian

  25. InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting

    Jul 27, 2026Qi Zhang, Xinquan Yu, Kaiyi Zhang +13D Semantic Occupancy PredictionOccupancy

  26. SceneActBench: Can Agents Act on the 3D Scenes They See?

    Jul 24, 2026Yifei Zhao, Xiangxin Zhou, Wenhao Yang +113D Scene UnderstandingScene Understanding

  27. D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

    Jul 21, 2026Heesang Han, A. Lynn Abbott, Abhijit SarkarAutonomous DrivingWaymo Open Motion Dataset

  28. CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

    Jul 21, 2026Hao Wu, Jinjing Zhu, Nanyu Wu +43D Editing3D Scene Understanding

  29. Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning

    Jul 18, 2026Yuqi Zhang, Yadan Luo, Xiangyu Sun +33D Scene GenerationIndoor Scene Generation

  30. SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

    Jul 16, 2026Yi Wu, Junjie An, Xiao Liu +6Vision-Language NavigationObject Goal Navigation

  31. ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

    Jul 15, 2026Yuan Xiao, Can Wang, Xiangyu Kong +13D Scene Generation3D Scene Understanding

  32. HIVE-3D: Hierarchical Voxel Enhancement for High-Quality 3D Scene Generation

    Jul 15, 2026Bin Zang, Wenting Zheng, Xiaoliang Luo +83D Scene Generation3D Scene Understanding

  33. VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

    Jul 14, 2026Mohan Liu, Zhihao Gu, Xuanyu Chen +5Diffusion-Based Vision-Language-Actions3D Scene Understanding

  34. CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding

    Jul 11, 2026Yuang Jia, Jinlong Wang, Junhong Lin +23D Scene UnderstandingGaussian Primitives

  35. MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

    Jul 9, 2026Hantao Zhang, Jinru Sui, Ed Li +2Multi-View3D Scene Understanding

  36. CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

    Jul 7, 2026He Liang, Chenyang Ma, Yiming Zhang +43D Scene Understanding

  37. PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

    Jul 7, 2026Xiaopei Wu, Chenshu Hou, Liang Peng +93D Scene UnderstandingVoxel

  38. Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

    Jul 6, 2026Amol Harsh, Zongyan Han, Jean Lahoud +53D Visual Grounding3D Scene Understanding

  39. Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

    Jul 6, 2026Xianhao Chen, Jiarui Hu, Yuanbo Yang +53D Scene Understanding3D Scene Graphs

  40. Holo-Captioning: Toward the Text Equivalent of 3D Scenes

    Jul 3, 2026Kun-Yu Lin, Chengke Bu, Zhenguo Li +13D Scene Understanding3D Generation

  41. VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

    Jul 2, 2026Marwane Hariat, David Filliat, Antoine Manzanera3D Scene UnderstandingVision-Language Reprojection Consistency

  42. Alignment Is All You Need For X-to-4D Generation

    Jul 2, 2026Qiaowei Miao, Kehan Li, Yawei Luo +14D Generation3D Scene Understanding

  43. Mirror Illusion Art

    Jul 2, 2026Xiaopei Zhu, Zeyuan Li, Jun Zhu +1ArtGenerative Inverse Design

  44. Structured 4D Latent Predictive Model for Robot Planning

    Jul 1, 2026Zhiyi Li, Peilin Wu, Xiaoshen Han +2Robot PlanningInverse Dynamics

  45. IBRSteG: Learning a Generalizable Steganography Framework for 3D Gaussian Splatting

    Jun 29, 2026Fanye Kong, Hongyu Xia, Yu Zheng +33D GaussianSteganography

  46. Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

    Jun 28, 2026Mijin Yoo, In Cho, Subin Jeon +33D Scene UnderstandingNovel View Synthesis

  47. Agentic Collaborative Cognition for Zero-Shot 3D Understanding

    Jun 23, 2026Wenxin Wang, Bo Zhang, Feng Chen +43D Scene UnderstandingFuzzy Cognitive Map

  48. MeshFlow: Mesh Generation with Equivariant Flow Matching

    Jun 22, 2026Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan +6Mesh GenerationRiemannian Flow Matching

  49. Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

    Jun 19, 2026Marwane Hariat, Gianni Franchi, David Filliat +13D Scene Understanding3D Generation

  50. JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

    Jun 18, 2026Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang +13D Generative Models3D Scene Understanding

  51. Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

    Jun 18, 2026Jianing Li, Zhou Fang, Yijiang Liu +13D Scene Understanding3D Representation

  52. QueryGaussian: Scalable and Training-Free Open-Vocabulary 3D Instance Retrieval

    Jun 18, 2026Xiuyuan Zhu, Ke Lu, Zijie Yang +33D Scene Understanding3D Generation

  53. 3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

    Jun 17, 2026Ellina Zhang, Madhaven Iyengar, Amir Zadeh +43D Scene Understanding3D Generation

  54. OneCanvas: 3D Scene Understanding via Panoramic Reprojection

    Jun 17, 2026Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner3D Scene UnderstandingSpatial Reasoning

  55. EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation

    Jun 8, 2026Runsong Zhu, Jiaxin Guo, Xiaoyang Guo +9Open-Vocabulary 3D Segmentation3D Scene Understanding