3D Representation Learning

Latest papers 129

All topics
CardsList
  1. PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

    Aug 3, 2026Guangming Fu, Jin Song, Yiyun Fei +3Part-Level 3D Generation3D Asset Generation

  2. Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

    Aug 2, 2026Robin Kim, Colin Samplawski, Benjamin M. MarlinDetection TransformerRepresentation Probing

  3. P2Voxel: Pyramid Pivot Voxelization for 3D Mesh Tokenization

    Aug 1, 2026Zhenhong Sun, Haozhe Liu, Yifu Wang +63D Reconstruction3D Mesh Reconstruction

  4. MeshFM: 2D Features Are All You Need for 3D Shape Understanding

    Jul 30, 2026Jinfan Zhou, Richard Liu, Itai Lang +13D Representation Learning

  5. Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

    Jul 28, 2026Quoc-Huy Trinh, Minh-Van Nguyen, Ulas BagciMedical Imaging Foundation Models3D Medical Imaging

  6. SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

    Jul 28, 2026Zonghe Liu, Shanyuan Jie, Xiaoquan Sun +4Long-Horizon Robotic ManipulationObject-Centric Representation Learning

  7. MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

    Jul 27, 2026Dehao Hao, Kaiyi Zhang, Tanghui Jia +10Variational Autoencoders3D Reconstruction

  8. 3D-Aware VLMs with Implicit and Explicit Geometries

    Jul 23, 2026Wenhao Li, Xueying Jiang, Quanhao Qian +43D Spatial Reasoning3D Object Detection

  9. Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

    Jul 21, 2026Lisa Weijler, Irene Ballester, Guofeng Mei +23D Foundation ModelsFlow Matching

  10. ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

    Jul 19, 2026Qiwei Han, Chi Zhou3D Representation LearningMultimodal Fusion

  11. SeeSE3: Emergence of 3D Space in Vision Features

    Jul 15, 2026Caroline Chen, Sayna Ebrahimi, Fedor Kitashov +4Geometric Representation LearningVisual Odometry

  12. TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model

    Jul 15, 2026Zhenkai Zhang, Krista A. Ehinger, Tom Drummond3D Medical ImagingMedical Image Synthesis

  13. What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

    Jul 10, 2026Filippo Ziliotto, Luciano Serafini, Lamberto Ballan +1Multi-View Geometry3D Representation Learning

  14. Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

    Jul 7, 2026Jiaming Liu, Qingpo Wuwu, Nuowei Han +8Robotic ManipulationVision-Language-Action Models

  15. GaussFusion: Towards Multimodal 3D Gaussian Pretraining

    Jul 7, 2026Zhixuan You, Jihua Zhu, Yiding Sun +53D Gaussian SplattingCross-Modal Representation Learning

  16. How to Build Digital Humans? From Priors to Photorealistic Avatars

    Jul 5, 2026Wojciech Zielonka, Tobias Kirschstein, Timo Bolkart +83D Asset Generation3D Avatar Generation

  17. Sign in the Air to Unlock: An Interface for authentication in Virtual and Augmented Reality Powered by Point-Voxel Cross-Attention Network

    Jul 1, 2026Neda Abdolrahimi, Thiru Siddharth, Frank Sicong chen +1Biometric Identification3D Representation Learning

  18. Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

    Jul 1, 2026Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo +2Cross-Modal Knowledge DistillationPoint Cloud Learning

  19. Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

    Jun 30, 2026Gaochao Song, Haohan Weng, Luo Zhang +23D Mesh Generation3D Representation Learning

  20. Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning

    Jun 30, 2026Xu Yan, Huiqun Wang, Chen Wang +2Masked AutoencodersPoint Cloud Learning

  21. Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking

    Jun 29, 2026Maximilian Luz, Thomas Nürnberg, Yakov Miron +1Autonomous Driving3D Occupancy Prediction

  22. Emergence of a Shared Canonical Object Frame from In-the-Wild Videos

    Jun 29, 2026Tom Fischer, Martin Sundermeyer, Adam Kortylewski +1Object Pose Estimation3D Representation Learning

  23. Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

    Jun 29, 2026Zhiqi Li, Chengrui Dong, Zhenhua Du +6Camera-Conditioned Video GenerationLong-Horizon Video Generation

  24. 3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

    Jun 22, 2026Amirhossein Kardoost, Lion Gleiter, Tingying Peng +1Cross-Modal Representation LearningMasked Autoencoders

  25. Deciphering Fingerprints of 3D Molecular Surfaces for Accurate Epitope Prediction

    Jun 22, 2026Fang Wu, Weihao Xuan, Jure Leskovec +23D Representation LearningMolecular Representation Learning

  26. Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

    Jun 19, 2026Yashom Dighe, Karthik DantuDexterous ManipulationPoint Cloud Learning

  27. Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

    Jun 19, 2026Marwane Hariat, Gianni Franchi, David Filliat +1Multi-View ConsistencyBayesian Inference

  28. SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

    Jun 18, 2026Jiayu Tang, Yuchen Zhou, Chao Gou3D Spatial ReasoningVLM Interpretability