Efficient ViTs

ViT: Vision Transformer

Momentum

20 papers in the last four weeks, up 300% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 152

All topics
CardsList
  1. One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

    Oct 8, 2026Adrian Bulat, Yassine Ouali, Georgios TzimiropoulosEfficient ViTsMixture of Experts

  2. SV-TAD: Native Sparse Convs for Efficient Temporal Action Detection

    Oct 8, 2026Ricardo Pizarro, Roberto Valle, José M. Buenaposada +2Temporal Action DetectionEfficient ViTs

  3. Dissecting Representation Structure in Vision Transformers: A Rigorous Architectural Study

    Oct 8, 2026Kim-Cuc Nguyen, Ngai-Man CheungVision TransformerNeural Network Generalization

  4. Hardware-aware Calibrated Clustered Attention for Efficient Visual Geometric Transformers

    Oct 7, 2026Weitian Wang, Shubham Rai, Cecilia De La Parra +1Efficient ViTsAttention Mechanisms

  5. VASC: Value-Aware Sparse Attention with Cross-Layer Memory for Efficient 3D Reconstruction

    Oct 1, 2026Junyi Wu, Fanqing Kong, Leyang Chen +23D ViTs3D Reconstruction

  6. Pixel-Level Transformers in Remote Sensing: A Canopy Height Case Study

    Sep 29, 2026Sven Ligensa, Jan Pauls, Karsten Schrödter +2Remote Sensing Image UnderstandingRemote Sensing

  7. EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception

    Sep 29, 2026Yaoxin Niu, Zhangquan Chen, Yang Zhang +5VLM AdaptationEfficient ViTs

  8. Copy the Same, Distill the Difference: Initializing Linear Vision Transformers

    Sep 28, 2026Huaiyuan Qin, Muli Yang, Gabriel James Goenawan +9Neural Network InitializationVision Transformer

  9. ReSS: Residual-Restoring Sparse Attention for 3D Vision Transformers

    Sep 28, 2026Yongsung Kim, Jaehoon Lee, Minjun Park +33D ViTsEfficient ViTs

  10. DORA: Dynamic Online Reinforcement Agent for Token Pruning in Vision Transformers

    Sep 28, 2026Kaixuan He, Song Chen, Yi KangVision TransformerEfficient ViTs

  11. TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining

    Sep 27, 2026Shih-Ying Yeh, Daniel Z. Kaplan, Xuehai Wang +3Efficient ViTsVideo Representation Learning

  12. LoopTrack: A Simple Baseline for Parameter-Efficient Transformer Tracking

    Sep 27, 2026Liang Peng, Chenxiao Li, Libo Zhang +2Visual Object TrackingRecurrent Transformers

  13. IronViT: Toward Efficient Generalist Visual Representation Learning

    Sep 24, 2026Jiaxi Huang, Yueqi Hu, Xin Zhu +13Visual Representation LearningEfficient ViTs

  14. Less is More: Encoder-only Audio-Visual Segmentation

    Sep 24, 2026Ilpo Viertola, Vladimir Iashin, Sophie Tötterström +1Audio-Visual UnderstandingEfficient ViTs

  15. Task-Induced Riemannian Metrics for Vision Transformer Feature Spaces

    Sep 23, 2026Andrew Bond, Ege Erdem Özlü, Tuna Çimen +4Vision TransformerGeometric Representation Learning

  16. GTR: Gated Token Recurrence for Efficient Dense Prediction

    Sep 22, 2026Zhe Feng, Longfei Liu, Wei Liu +7Efficient Neural Network InferenceGated Attention

  17. LiAuto-MindViT: A Hybrid Vision Backbone with Adaptive Bidirectional Mamba

    Sep 21, 2026Lifu Mu, Shuai Chen, Wen Zheng +7Hybrid CNN-Transformer ArchitecturesVisual SSMs

  18. VGGT-Prime: Compute-Adaptive Mixture-of-Heads for Efficient Visual Geometry Transformers

    Sep 20, 2026Abteen Arab, Guile Wu, Chengjie Huang +13D ViTsMulti-View 3D Reconstruction

  19. Rethinking Vision Architectures with Gated Linear Attention and KAN

    Sep 18, 2026Ali Mehizel, Oussama KhaldiVisual Representation LearningVision Transformer

  20. A Smaller Transformer in Your Transformer

    Sep 17, 2026Dhananjay Tomar, Marius Aasan, Andreas Kleppe +1Transformer InferenceVision Transformer

  21. Vision Transformer-Based Multi-Level Feature Fusion for Multi-Label Sewer Defect Classification

    Sep 11, 2026Xu Fang, Zhuoran Wang, Qing Li +4Vision TransformerMulti-Scale Feature Fusion

  22. FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation

    Sep 11, 2026Vladislav Bargatin, Alexander Yakovenko, Khaled Abud +1Optical FlowVision Transformer

  23. CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids

    Sep 9, 2026Toomas Tahves, Mauro Bellone, Raivo SellCamera-LiDAR FusionAutonomous Driving Perception

  24. Mind the Approximation: Fisher-Weighted SVD Compression for ViTs

    Sep 7, 2026Moritz Thoma, Maximilian Groezinger, Maximilian Forstenhäusler +7Efficient ViTsLow-Rank Compression

  25. ProgResViT: Progressive Resolution and Width for Adaptive Vision Transformers

    Sep 2, 2026Ali Hojjat, Janek Haberer, Olaf LandsiedelVision TransformerEfficient ViTs

  26. Swin Meets EfficientNet: Lightweight Architectures for GAN-Based Face Forensics

    Sep 1, 2026Sejuti Basu, Ashima Sood, Vijay Kumar +1Hybrid CNN-Transformer ArchitecturesEfficient ViTs

  27. UniCon-Former: Unified Convolution Transformer is All You Need for Hand Gesture Recognition

    Aug 13, 2026Mallika Garg, Debashis Ghosh, Pyari Mohan PradhanHybrid CNN-Transformer ArchitecturesEfficient ViTs

  28. MergeOver: Post-Training Token Merging for Recursive Vision Transformers

    Aug 13, 2026Junseo Kim, Uraz Odyurt, Amirreza YousefzadehVision TransformerEfficient ViTs

  29. Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

    Aug 11, 2026Hongsen Cao, Mona Jaber, Shanxin Yuan +1Token PruningEfficient ViTs