3D ViTs

ViT: Vision Transformer

Momentum

13 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 81

All topics
CardsList
  1. Z-Order Transformer for Feed-Forward Gaussian Splatting

    May 13, 2026Can Wang, Lei Liu, Wei Jiang +13D Gaussian Splatting3D ViTs

  2. OCH3R: Object-Centric Holistic 3D Reconstruction

    May 13, 2026Yi Du, Yang You, Xiang Wan +13D ViTs3D Reconstruction

  3. RelFlexformer: Efficient Attention 3D-Transformers for Integrable Relative Positional Encodings

    May 11, 2026Byeongchan Kim, Arijit Sehanobish, Avinava Dubey +23D ViTsSelf-Attention

  4. Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval

    May 10, 2026Zichen Zou, Xiaosong Jia, Zuxuan Wu +13D ViTsStreaming 3D Reconstruction

  5. A Multi-Dataset Benchmark of Multiple Instance Learning for 3D Neuroimage Classification

    Apr 29, 2026Ethan Harvey, Dennis Johan Loevlie, Amir Ali Satani +33D ViTsConvolutional Neural Networks

  6. PointTransformerX: Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms

    Apr 27, 2026Laurenz Reichardt, Nikolas Ebert, Oliver WasenmüllerRotary Positional Embeddings3D ViTs

  7. EdgeFormer: local patch-based edge detection transformer on point clouds

    Apr 23, 2026Yifei Xie, Zhikun Tu, Tong Yang +23D ViTsPoint Cloud Learning

  8. SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation

    Apr 22, 2026Chris Choy, Junha Lee, Chunghyun Park +23D ViTs3D Instance Segmentation

  9. GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction

    Apr 21, 2026Pradyumna YM, Yuxuan Xue, Yue Chen +33D ViTs3D Reconstruction

  10. Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding

    Apr 21, 2026Kadir Yilmaz, Adrian Kruse, Tristan Höfer +23D ViTs3D Semantic Segmentation

  11. Dual-stream Spatio-Temporal GCN-Transformer Network for 3D Human Pose Estimation

    Apr 20, 2026Jiawen Duan, Jian Xiang, Zhiqiang Li +23D ViTs3D Reconstruction

  12. LOD-Net: Locality-Aware 3D Object Detection Using Multi-Scale Transformer Network

    Apr 17, 2026Mustaqeem Khan, Aidana Nurakhmetova, Wail Gueaieb +13D ViTsPoint Cloud Learning

  13. R3D: Revisiting 3D Policy Learning

    Apr 16, 2026Zhengdong Hong, Shenrui Wu, Haozhe Cui +83D ViTsVisuomotor Policy Learning

  14. TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens

    Apr 16, 2026Jiawei Ren, Michal Jan Tyszkiewicz, Jiahui Huang +13D Gaussian Splatting3D ViTs

  15. StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression

    Apr 16, 2026Xuanyi Liu, Chunan Yu, Deyi Ji +63D ViTsStreaming 3D Reconstruction

  16. LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows

    Apr 6, 2026Zhengqin Li, Cheng Zhang, Jakob Engel +1Inverse Rendering3D ViTs

  17. Utonia: Toward One Encoder for All Point Clouds

    Mar 3, 2026Yujia Zhang, Xiaoyang Wu, Yunhan Yang +63D Foundation Models3D ViTs

  18. CATSplat: Context-Aware Transformer with Spatial Guidance for Generalizable 3D Gaussian Splatting from A Single-View Image

    Dec 17, 2024Wonseok Roh, Hwanhee Jung, Jong Wook Kim +63D Gaussian Splatting3D ViTs

  19. Tackling fluffy clouds: robust agricultural field boundary delineation from Sentinel-1 and Sentinel-2 satellite image time series

    Sep 20, 2024Foivos I. Diakogiannis, Zheng-Shu Zhou, Jeff Wang +133D ViTsRemote Sensing Image Segmentation

  20. Multi-view Hand Reconstruction with a Point-Embedded Transformer

    Aug 20, 2024Lixin Yang, Licheng Zhong, Pengxiang Zhu +43D ViTsMarkerless Motion Capture