Visual Geometry Grounded Transformer

Latest papers 69

All topics
CardsList
  1. Geometry-physics confounding impairs PDE learning across varying domains

    Sep 29, 2026Yinghao Cheng, Gengxiang Chen, Xu Liu +6Partial Differential EquationsProbabilistic Operator Learning

  2. Does the VGGT Family Need All Its Layers?

    Sep 29, 2026Fengyi Zhang, Holger Caesar, Xiangyu Sun +3Visual Geometry Grounded TransformerFeed-Forward 3D Reconstruction

  3. ReSS: Residual-Restoring Sparse Attention for 3D Vision Transformers

    Sep 28, 2026Yongsung Kim, Jaehoon Lee, Minjun Park +3Visual Geometry Grounded TransformerDynamic Sparse Attention

  4. A Unified Framework and Dataset for Oriented Object Visual Grounding in Remote Sensing

    Sep 23, 2026Zeyu Ding, Yong Zhou, Jiaqi Zhao +5Weak Visual GroundingRemote Sensing

  5. Revisiting Multi-View Stereo: A Sequence-to-Sequence Formulation

    Sep 21, 2026Aoxiang Fan, Corentin Dumery, Nicolas Talabot +1Visual Geometry Grounded TransformerMulti-View

  6. VGGT-Prime: Compute-Adaptive Mixture-of-Heads for Efficient Visual Geometry Transformers

    Sep 20, 2026Abteen Arab, Guile Wu, Chengjie Huang +1Visual Geometry Grounded TransformerSelf-Supervised Vision Transformers

  7. G-ray: Ray-Level Relative Geometric Position Encoding in Multi-View Vision Transformers under Camera Heterogeneity

    Sep 14, 2026Shuo Zhang, Xin Su, Wei Wang +8Visual Geometry Grounded TransformerPositional Encoding

  8. GeoCache: Training-Free Acceleration of Multi-View Texture Diffusion via Geometric Delta Transport

    Aug 13, 2026Haotang Li, Zhenyu Qi, Shaohan Henry Wang +6TextureMulti-View

  9. ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference

    Aug 12, 2026Youze Huang, Penghui Ruan, Bojia Zi +3Visual Geometry Grounded TransformerScene Reconstruction

  10. HSTGFormer: Hyper Spatial-Temporal Graph Transformer for 3D Human Pose Estimation

    Aug 12, 2026Ruochen Li, Shuang Chen, Wenke E +2Wifi-Csi 3D Human Pose EstimationSpatio-Temporal Transformers

  11. Visual Geometry Foundation-Aware Gaussians for Single-Frame Surround-View Driving Reconstruction

    Aug 11, 2026Junhong Lin, Jinlong Wang, Xianda Guo +6Visual Geometry Grounded TransformerGeometric Priors

  12. Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory

    Aug 7, 2026Kaustubh Kapil, Kishor P. UplaTransformer ArchitecturesVisual Geometry Grounded Transformer

  13. Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory

    Aug 3, 2026Kaustubh Kapil, Kishor P. UplaVisual Geometry Grounded TransformerGeometric Machine Learning

  14. RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning

    Jul 31, 2026Qian Wang, Longrui Chen, Peiran Sun +8Visual Geometry Grounded TransformerRobotic Perception

  15. Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations

    Jul 26, 2026Xianghao Jiao, Ruoyu Chen, Wei Wang +6Gradient-Weighted Class Activation MappingRegularization

  16. SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

    Jul 24, 2026Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo +3Structure-From-Motion4D Reconstruction

  17. IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

    Jul 21, 2026Zhengyu Zou, Hao Li, Kuixuan Jiao +7Visual Geometry Grounded Transformer4D Reconstruction

  18. Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

    Jul 21, 2026Lisa Weijler, Irene Ballester, Guofeng Mei +23D Foundation ModelsRiemannian Flow Matching

  19. What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

    Jul 10, 2026Filippo Ziliotto, Luciano Serafini, Lamberto Ballan +1Visual Geometry Grounded TransformerSequential Visual Localization

  20. Diversity-aware View Partitioning for Scalable VGGT

    Jul 2, 2026Jinsoo Park, Donggyu Choi, Ahyun Seo +2Visual Geometry Grounded TransformerMulti-View

  21. Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images

    Jul 2, 2026Hu Zhu, Bohan Li, Xianda Guo +53D GaussianVoxel

  22. RenderFormer++: Scalable and Physically Grounded Feed-Forward Neural Rendering

    Jun 29, 2026Huangsheng Du, Haoran Zhu, Youcheng Cai +2Neural RenderingVisual Geometry Grounded Transformer

  23. VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

    Jun 23, 2026Ling Li, Zhizhen Cai, Xinkun Wu +4Visual Geometry Grounded TransformerObject Detection

  24. G3^3VLA: Geometric inductive bias for Vision-Language-Action Models

    Jun 23, 2026Yue Peng, Yongzhe Zhao, Artur Habuda +5Diffusion-Based Vision-Language-ActionsVisual Geometry Grounded Transformer

  25. Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation

    Jun 23, 2026Tianyu Zhu, Yingping Liang, Hesong Li +1Video Object SegmentationVisual Geometry Grounded Transformer

  26. Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction

    Jun 22, 2026Tianbo Pan, Xingyi Yang, Shizun Wang +13D ReconstructionVisual Geometry Grounded Transformer

  27. Transformer Geometry Observatory TGO-I: Spectral Geometry Observatory

    Jun 17, 2026Kaustubh Kapil, Kishor P. UplaVisual Geometry Grounded TransformerVision Transformer

  28. RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

    Jun 16, 2026Jinhao You, Shuo Lyu, Zhuohang Lyu +5Visual Geometry Grounded TransformerSelf-Supervised Vision Transformers

  29. MVM-IOD: An Industrial Object-Centric Benchmark Dataset for the Evaluation of 3D Reconstruction Methods

    Jun 15, 2026Robert Langendörfer, Markus Hillemann, Markus Ulrich3D ReconstructionLocal Camera Pose

  30. Uncertainty Quality of VGGT: An Analysis on the DTU Benchmark Dataset

    Jun 15, 2026Markus Hillemann, Robert Langendörfer, Steven Landgraf +1Visual Geometry Grounded TransformerReconstruction Fidelity

  31. SGFormer++: Semantic Graph Transformer for Incremental 3D Scene Graph Generation

    Jun 13, 2026Mengshi Qi, Changsheng Lv, Zijian Fu +23D Scene GraphsVisual Geometry Grounded Transformer

  32. Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery

    Jun 11, 2026Siyu Zhou, Zhongliang JiangPoint Cloud RegistrationVisual Geometry Grounded Transformer

  33. PT-WNO: Point Transformer with Wavelet Neural Operator for 3D Point Cloud Semantic Segmentation

    Jun 9, 2026Nhut Le, Maryam RahnemoonfarPoint CloudsSemantic Segmentation

  34. Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers

    Jun 3, 2026Jean Cordonnier, Chenghao Xu, Olga Fink +1Rgb-ThermalNovel View Synthesis

  35. VG2\text{VG}^2GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer

    Jun 1, 2026Yibin Zhao, Yihan Pan, Jun Nan +3Visual Geometry Grounded TransformerGaussian Splatting

  36. QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer

    May 29, 2026Zhizhen Pan, Hesong Wang, Huan WangVisual Geometry Grounded Transformer3D Perception

  37. GeoMag: Geometric-Aware Video Motion Magnification via State Space Model

    May 28, 2026Kecheng Han, Yuchen Zhang, Bingqing Liu +3Visual Geometry Grounded TransformerMotion Estimation

  38. Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning

    May 26, 2026Sridhar MahadevanTransformer ArchitecturesVisual Geometry Grounded Transformer

  39. Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

    May 23, 2026Yurou Yang, Muyuan Lin, Roberto Martin-Martin +4Visual Geometry Grounded TransformerDiffusion-Based Vision-Language-Actions

  40. Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

    May 22, 2026Shuhong Zheng, Michael Oechsle, Erik Sandström +3Visual Geometry Grounded TransformerSelf-Supervised Vision Transformers

  41. UniT: Unified Geometry Learning with Group Autoregressive Transformer

    May 20, 2026Haotian Wang, Yusong Huang, Zhaonian Kuang +4Visual Geometry Grounded TransformerAutoregressive Transformers

  42. Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

    May 17, 2026Tianchen Deng, Zhenxiang Xiong, Nailin Wang +4Visual Geometry Grounded Transformer3D Reconstruction

  43. IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation

    May 15, 2026Yuqi Wu, Tianyu Hu, Wenzhao Zheng +4Visual Geometry Grounded Transformer3D Geometry

  44. Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

    May 15, 2026Yipu Zhang, Jintao Cheng, Weilun Feng +5Feed-Forward 3D ReconstructionVisual Geometry Grounded Transformer

  45. VGGT-ΩΩ

    May 14, 2026Jianyuan Wang, Minghao Chen, Shangzhan Zhang +7Visual Geometry Grounded TransformerScene Reconstruction

  46. TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention

    May 14, 2026David Huang, Guile Wu, Chengjie Huang +2Visual Geometry Grounded Transformer3D Reconstruction

  47. 4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation

    May 12, 2026Ying Zang, Xuanyi Liu, Yidong Han +94D ReconstructionVisual Geometry Grounded Transformer

  48. Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval

    May 10, 2026Zichen Zou, Xiaosong Jia, Zuxuan Wu +1Visual Geometry Grounded Transformer3D Reconstruction

  49. Mechanistic Analysis of Alignment Algorithms in Language Models

    May 9, 2026Aarush Sinha, Ishan Garg, Veeraraju Elluru +2Large Language Model AlignmentPreference Alignment Learning

  50. PrePARE: Pre-AA Token Pruning for Frozen Multi-View Geometry Transformers

    May 8, 2026Haotang Li, Zhenyu Qi, Shaohan Henry Wang +5Visual Geometry Grounded TransformerVisual Token Pruning

  51. Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces

    Apr 30, 2026Andrew Bond, Ilkin Umut Melanlioglu, Erkut Erdem +1Visual Geometry Grounded TransformerDiscriminative Congruence Transform

  52. Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding

    Apr 21, 2026Kadir Yilmaz, Adrian Kruse, Tristan Höfer +23D Scene UnderstandingVisual Geometry Grounded Transformer

  53. URoPE: Universal Relative Position Embedding across Geometric Spaces

    Apr 20, 2026Yichen Xie, Depu Meng, Chensheng Peng +4Visual Geometry Grounded TransformerRotary Position Embedding

  54. Dual-stream Spatio-Temporal GCN-Transformer Network for 3D Human Pose Estimation

    Apr 20, 2026Jiawen Duan, Jian Xiang, Zhiqiang Li +2Wifi-Csi 3D Human Pose EstimationSpatio-Temporal Transformers