3D Representation Learning

Latest papers 127

All topics
CardsList
  1. ActiveLang: Active Open-Vocabulary 3D Mapping with Semantic-Uncertainty-Guided Exploration

    Oct 7, 2026Liyan Chen, Hairong Yin, Huangying Zhan +33D Scene RepresentationOpen-Vocabulary 3D Segmentation

  2. Atom-JEPA: Joint-Embedding Predictive Architecture for 3D Atomistic Systems

    Oct 6, 2026Kasper Helverskov Petersen, Rasmus Hannibal Tirsgaard, François R J Cornet +2Joint-Embedding Predictive ArchitectureMaterials Property Prediction

  3. SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation

    Oct 1, 2026Tianjiao Yu, Xinzhuo Li, Yifan Shen +43D Shape Generation3D Representation Learning

  4. PAGER: Partial-to-global Alignment via Geometric and Relational Distillation

    Oct 1, 2026Akira-Miranda Adeyomi Adeniran-Lowe, Binod Singh, Lars Arnold Dethlefsen +23D Semantic Segmentation3D Representation Learning

  5. Planning Oriented 3D Scene Completion via Coupled TUDF Occupancy Representation Learning from Partial Observations

    Sep 29, 2026Tianyou Yu, Pengfei Zhao, Chao Xu3D Occupancy Prediction3D Representation Learning

  6. From Surfaces to Volumes: Registered Geometry for Protein Representation Learning

    Sep 28, 2026Siyuan Chen, Cai Zhou, Jinrui Zhang +8Protein-Protein Interaction Prediction3D Representation Learning

  7. Sparse-View Interpretable 3D Animal Behavior Representations for Neural Encoding and Decoding

    Sep 28, 2026Xinming Dai, Qihang Jin, Tianshu Tan +8Representation LearningSparse-View 3D Reconstruction

  8. LEGAU: Learning Semantic Gaussian Priors for Scalable Category-level Pose Estimation

    Sep 28, 2026Hongli Xu, Zhaowei Lu, Junwen Huang +5Object Pose Estimation3D Representation Learning

  9. PGL-3D: Towards Progressive Geometric Learning for 3D Visual Query Localization

    Sep 27, 2026Liang Peng, Shizhuo Mu, Bohan Tan +6Geometric Representation Learning3D Representation Learning

  10. KeyGen: Unsupervised Keypoint based Object-Centric Representations for Category-Level Policy Generalization

    Sep 23, 2026Shuxin Cao, Liquan Wang, Masoud Moghani +2Point Cloud LearningGeneralization in Robotic Manipulation

  11. From Alignment to Fusion in 3D Vision-Language

    Sep 23, 2026Xueqi Qiu, Xingyu Miao, Jingjing Deng +33D Representation LearningVision-Language Alignment

  12. GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

    Sep 21, 2026Jiahao Lu, Minghao Yin, Wenbo Hu +53D Scene Generation3D Scene Representation

  13. ParticleSplat: Self-supervised Object-centric Latent Particle Splatting

    Sep 16, 2026Lyuxing He, Daniel Guo, Elizabeth Terveen +33D Gaussian SplattingObject-Centric Representation Learning

  14. PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

    Sep 16, 2026Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung +53D Point Tracking3D Representation Learning

  15. Geometry Without Coordinates: LiDAR Diffusion as a 3D Feature Bridge

    Sep 9, 2026Samed Doğan, Nico Leuze, Alfred Schöttl3D Semantic SegmentationTransfer Learning

  16. RoMa-ΩΩ: What Feed-Forward 3D Models Know About Image Matching

    Sep 8, 2026David Nordström, Xinyue Zhang, Thibaut Loiseau +2Image Matching3D Representation Learning

  17. ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes

    Sep 1, 2026Mingda Lin, Weijie Wang, Zeyu Zhang +73D Reconstruction3D Representation Learning

  18. Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error Comparison

    Sep 1, 2026Thibaut Loiseau, Guillaume Bourmaud, Vincent LepetitSelf-Supervised Pre-Training3D Representation Learning

  19. Neuro-Symbolic Geometric Abstraction (NeuSOGA): From Observations to Symbolic Mathematical Representations

    Sep 1, 2026Qingde Li, Qingqi Hong, Zihan Li +1Representation LearningGeometric Representation Learning

  20. Feed-Forward Multi-view Multi-person Reconstruction with Contrastive Human-Aware 3D Representation

    Sep 1, 2026Yuanwang Yang, Buzhen Huang, Zongxuan Ren +2Multi-View 3D Reconstruction3D Human Reconstruction

  21. Rotational Equivariance in Machine Learning: A Comprehensive Tutorial

    Aug 31, 2026Peter Lippmann, Fred A. HamprechtEquivariant Neural NetworksGeometric Representation Learning

  22. DINOcular: Self-Supervised Visuospatial Representations

    Aug 27, 2026Farkhat Almukhamedov, Sami Azirar, Hermann BlumVisual Representation LearningGeometric Representation Learning

  23. DDMS: Discriminative Distillation of Multi-view Foundational Features into Single-view Models

    Aug 24, 2026Jeong-gi Kwak, Sho Kagami, Yuki Ono +1Multi-View ConsistencyVisual Representation Learning

  24. Geometry-Grounded Unified 3D Perception for Autonomous Driving

    Aug 13, 2026Longfei Xu, Xiaohui Wang, Zehao Huang +4Depth EstimationAutonomous Driving Perception

  25. LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

    Aug 6, 2026Jiarui Yang, Jiale Zhange, Jiawei Li +5Latent Action LearningWorld Models for Robotics

  26. Physics-Based Molecular Fingerprints from Spectral Graph Theory Provide Efficient Geometry-Aware Measures of Chemical Similarity

    Aug 5, 2026Jacob W. Toney, Ayleen Y. Farnood, Samir Darouich +13D Representation LearningSpectral Methods

  27. VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification

    Aug 3, 2026Chao Ji, Shiyu Xuan, Zechao Li3D Representation LearningInvariant Representation Learning

  28. Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling

    Aug 3, 2026Kaiyi Zhang, Zhihao Liang, Haolin Liu +8Variational AutoencodersAutoencoders

  29. PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

    Aug 3, 2026Guangming Fu, Jin Song, Yiyun Fei +3Part-Level 3D Generation3D Asset Generation

  30. Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

    Aug 2, 2026Robin Kim, Colin Samplawski, Benjamin M. MarlinDetection TransformerRepresentation Probing

  31. P2Voxel: Pyramid Pivot Voxelization for 3D Mesh Tokenization

    Aug 1, 2026Zhenhong Sun, Haozhe Liu, Yifu Wang +63D Reconstruction3D Mesh Reconstruction

  32. MeshFM: 2D Features Are All You Need for 3D Shape Understanding

    Jul 30, 2026Jinfan Zhou, Richard Liu, Itai Lang +13D Representation Learning

  33. Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

    Jul 28, 2026Quoc-Huy Trinh, Minh-Van Nguyen, Ulas BagciMedical Imaging Foundation Models3D Medical Imaging

  34. SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

    Jul 28, 2026Zonghe Liu, Shanyuan Jie, Xiaoquan Sun +4Long-Horizon Robotic ManipulationObject-Centric Representation Learning

  35. MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

    Jul 27, 2026Dehao Hao, Kaiyi Zhang, Tanghui Jia +10Variational Autoencoders3D Reconstruction

  36. 3D-Aware VLMs with Implicit and Explicit Geometries

    Jul 23, 2026Wenhao Li, Xueying Jiang, Quanhao Qian +43D Spatial Reasoning3D Object Detection

  37. Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

    Jul 21, 2026Lisa Weijler, Irene Ballester, Guofeng Mei +23D Foundation ModelsFlow Matching

  38. ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

    Jul 19, 2026Qiwei Han, Chi Zhou3D Representation LearningMultimodal Fusion

  39. SeeSE3: Emergence of 3D Space in Vision Features

    Jul 15, 2026Caroline Chen, Sayna Ebrahimi, Fedor Kitashov +4Geometric Representation LearningVisual Odometry

  40. TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model

    Jul 15, 2026Zhenkai Zhang, Krista A. Ehinger, Tom Drummond3D Medical ImagingMedical Image Synthesis

  41. What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

    Jul 10, 2026Filippo Ziliotto, Luciano Serafini, Lamberto Ballan +1Multi-View Geometry3D Representation Learning

  42. Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

    Jul 7, 2026Jiaming Liu, Qingpo Wuwu, Nuowei Han +8Robotic ManipulationVision-Language-Action Models

  43. GaussFusion: Towards Multimodal 3D Gaussian Pretraining

    Jul 7, 2026Zhixuan You, Jihua Zhu, Yiding Sun +53D Gaussian SplattingCross-Modal Representation Learning

  44. How to Build Digital Humans? From Priors to Photorealistic Avatars

    Jul 5, 2026Wojciech Zielonka, Tobias Kirschstein, Timo Bolkart +83D Asset Generation3D Avatar Generation

  45. Sign in the Air to Unlock: An Interface for authentication in Virtual and Augmented Reality Powered by Point-Voxel Cross-Attention Network

    Jul 1, 2026Neda Abdolrahimi, Thiru Siddharth, Frank Sicong chen +1Biometric Identification3D Representation Learning

  46. Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

    Jul 1, 2026Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo +2Cross-Modal Knowledge DistillationPoint Cloud Learning

  47. Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

    Jun 30, 2026Gaochao Song, Haohan Weng, Luo Zhang +23D Mesh Generation3D Representation Learning

  48. Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning

    Jun 30, 2026Xu Yan, Huiqun Wang, Chen Wang +2Masked AutoencodersPoint Cloud Learning

  49. Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking

    Jun 29, 2026Maximilian Luz, Thomas Nürnberg, Yakov Miron +1Autonomous Driving3D Occupancy Prediction

  50. Emergence of a Shared Canonical Object Frame from In-the-Wild Videos

    Jun 29, 2026Tom Fischer, Martin Sundermeyer, Adam Kortylewski +1Object Pose Estimation3D Representation Learning

  51. Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

    Jun 29, 2026Zhiqi Li, Chengrui Dong, Zhenhua Du +6Camera-Conditioned Video GenerationLong-Horizon Video Generation

  52. 3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

    Jun 22, 2026Amirhossein Kardoost, Lion Gleiter, Tingying Peng +1Cross-Modal Representation LearningMasked Autoencoders

  53. Deciphering Fingerprints of 3D Molecular Surfaces for Accurate Epitope Prediction

    Jun 22, 2026Fang Wu, Weihao Xuan, Jure Leskovec +23D Representation LearningMolecular Representation Learning

  54. Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

    Jun 19, 2026Yashom Dighe, Karthik DantuDexterous ManipulationPoint Cloud Learning

  55. Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

    Jun 19, 2026Marwane Hariat, Gianni Franchi, David Filliat +1Multi-View ConsistencyBayesian Inference

  56. SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

    Jun 18, 2026Jiayu Tang, Yuchen Zhou, Chao Gou3D Spatial ReasoningVLM Interpretability