3D ViTs

ViT: Vision Transformer

Momentum

13 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 81

All topics
CardsList
  1. Hardware-aware Calibrated Clustered Attention for Efficient Visual Geometric Transformers

    Oct 7, 2026Weitian Wang, Shubham Rai, Cecilia De La Parra +1Efficient ViTsAttention Mechanisms

  2. S2Tok: Streaming 3D Gaussian Reconstruction with Persistent Spatial Tokens

    Oct 6, 2026Fang Li, Jiraphon Yenphraphai, Quentin Herau +5Streaming 3D Reconstruction3D Scene Representation

  3. VGGT-Bridge: Beyond Sequential Pose Graphs via Coarse-Stride Skip Edges

    Oct 5, 2026Sungjae Choi, Hanna Bae, Sunghyun Baek +13D ViTsStreaming 3D Reconstruction

  4. Deep Prior Learning for Embodied Perception

    Oct 4, 2026Yimou Wu, Jiaxin Guo, Yun-hui Liu +13D ViTsCamera Pose Estimation

  5. VASC: Value-Aware Sparse Attention with Cross-Layer Memory for Efficient 3D Reconstruction

    Oct 1, 2026Junyi Wu, Fanqing Kong, Leyang Chen +23D ViTs3D Reconstruction

  6. RelationVGGT: Visual Geometry Transformers for 3D Spatial Relation Segmentation

    Oct 1, 2026Minsu Kim, Jaesung Choe, Jiwoo Lee +23D ViTs3D Spatial Reasoning

  7. ReSS: Residual-Restoring Sparse Attention for 3D Vision Transformers

    Sep 28, 2026Yongsung Kim, Jaehoon Lee, Minjun Park +33D ViTsEfficient ViTs

  8. Revisiting Multi-View Stereo: A Sequence-to-Sequence Formulation

    Sep 21, 2026Aoxiang Fan, Corentin Dumery, Nicolas Talabot +1Multi-View Depth Estimation3D ViTs

  9. STA-TFM: Spatio-Temporal Aggregation Across Views TransForMer for Pose Estimation

    Sep 21, 2026Mena Kamel, Natalie Won, Amrut Sarangi +23D ViTsMulti-View Learning

  10. VGGT-Prime: Compute-Adaptive Mixture-of-Heads for Efficient Visual Geometry Transformers

    Sep 20, 2026Abteen Arab, Guile Wu, Chengjie Huang +13D ViTsMulti-View 3D Reconstruction

  11. FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

    Sep 17, 2026Kevin Qu, Tao Sun, Massimiliano Viola +5Articulated Object Reconstruction3D ViTs

  12. G-ray: Ray-Level Relative Geometric Position Encoding in Multi-View Vision Transformers under Camera Heterogeneity

    Sep 14, 2026Shuo Zhang, Xin Su, Wei Wang +8Rotary Positional Embeddings3D ViTs

  13. DRS-VPT: Directly Relocalizing in a Scan with Vision Point Transformers

    Sep 14, 2026Lanke Frank Tarimo Fu, Maurice Fallon3D ViTsCamera Pose Estimation

  14. UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction

    Sep 14, 2026Xinqiang Yu, Zekun qi, Jiawei He +63D ViTsOpen-Vocabulary 3D Segmentation

  15. MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery

    Sep 11, 2026Boshu Jia, Rongyu Chen, Linlin Yang +93D ViTsHuman Mesh Recovery

  16. TokenMatch: 3D Mesh Correspondence Transformer with Curvature-Guided Tokenisation

    Sep 3, 2026Adeela Islam, Zorah Lähner, Vittorio Murino +13D ViTsNon-Rigid Shape Correspondence

  17. AQ3D: Adaptive Query Transformer for 3D Instance Segmentation

    Aug 31, 2026Keno Moenck, Thorsten Schüppstuhl3D ViTs3D Instance Segmentation

  18. A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

    Jul 30, 2026Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez3D ViTs3D Medical Image Segmentation

  19. Intrinsic and Triangulation-Agnostic Attention: A Simple and Powerful Approach for Learning on Meshes

    Jul 27, 2026Ashwath Shetty, Zihan Zhu, Soeren Pirk +13D ViTsGeometric Representation Learning

  20. SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

    Jul 24, 2026Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo +33D ViTs4D Reconstruction

  21. IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

    Jul 21, 2026Zhengyu Zou, Hao Li, Kuixuan Jiao +73D ViTsStreaming 3D Reconstruction

  22. MMA-Former: Multi-Window Mixture-of-Head Attention Transformer for Adaptive PNI Prediction in 3D MRI

    Jul 13, 2026Youngung Han, Induk Um, Kyeonghun Kim +93D ViTs3D Medical Imaging

  23. NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation

    Jul 7, 2026Shuheng Zhang, Feng Wu3D Point Cloud Segmentation3D ViTs

  24. SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

    Jul 3, 2026Jianing Deng, Yuanzhe Li, Jialu Wang +4Efficient Transformer Inference3D ViTs

  25. Diversity-aware View Partitioning for Scalable VGGT

    Jul 2, 2026Jinsoo Park, Donggyu Choi, Ahyun Seo +23D ViTsMulti-View 3D Reconstruction

  26. EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

    Jul 1, 2026Qiyan Luo, Yingdong Pi, Lekang Wen +4Remote Sensing Image Understanding3D ViTs

  27. DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers

    Jun 30, 2026Shun Kenney, Teppei Suzuki3D ViTsMulti-View Learning

  28. A Point Cloud Transformer for Remote Monitoring and Automated Assessment of Physical Rehabilitation Exercises

    Jun 29, 2026Kazi Rafat, Md. Ismail Hossain, M M Lutfe Elahi +43D ViTsHealthcare