Efficient ViTs

ViT: Vision Transformer

Momentum

20 papers in the last four weeks, up 300% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 152

All topics
CardsList
  1. Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

    May 22, 2026Shuhong Zheng, Michael Oechsle, Erik Sandström +33D ViTsMulti-View 3D Reconstruction

  2. Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models

    May 22, 2026Maxim Henry, Adrien Deliège, Sébastien Piérard +1Deep Learning OptimizationEfficient ViTs

  3. ASAP: Attention Sink Anchored Pruning

    May 21, 2026Jaehyuk Lee, Hanyoung Kim, Yanggee Kim +1Self-AttentionEfficient ViTs

  4. Accelerating Vision Foundation Models with Drop-in Depthwise Convolution

    May 21, 2026Carmelo Scribano, Mohammad Mahdi, Nedyalko Prisadnikov +5Vision Foundation ModelsVision Foundation Model Adaptation

  5. Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments

    May 20, 2026Van Quang NguyenImage CaptioningEfficient ViTs

  6. Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning

    May 19, 2026Zichao Zeng, June Moh Goo, Junwei Zheng +4Visual Place RecognitionEfficient ViTs

  7. LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift

    May 18, 2026Haozhe Si, Yuxuan Wan, Yuqing Wang +2Representation LearningMasked Autoencoders

  8. Token-Space Mask Prediction for Efficient Vision Transformer Segmentation

    May 18, 2026Calvin Galagain, Martyna Poreba, François GouletteVision TransformerEfficient ViTs

  9. SparseSAM: Structured Sparsification of Activations in Segment Anything Models

    May 17, 2026Hoai-Chau Tran, Chi H. Nguyen, Duy M. H. Nguyen +3Efficient Transformer InferenceImage Segmentation

  10. Systematic Evaluation of Vision Transformers for Automated Cervical Cancer Classification: Optimization, Statistical Validation, and Clinical Interpretability

    May 17, 2026Nisreen Albzour, Sarah S. LamVision TransformerEfficient ViTs

  11. From Sparsity to Simplicity: Enabling Simpler Sequential Replacements via Sparse Attention Distillation

    May 15, 2026Yuxin Ren, Maxwell D Collins, Miao Hu +1Self-AttentionVision Transformer

  12. Representative Attention For Vision Transformers

    May 14, 2026Yuntong Li, Hainuo Wang, Hengxing Liu +2Vision TransformerEfficient ViTs

  13. TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention

    May 14, 2026David Huang, Guile Wu, Chengjie Huang +23D ViTsMulti-View 3D Reconstruction

  14. SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection

    May 13, 2026Sandro Papais, Lezhou Feng, Charles Cossette +1Multi-View 3D Object DetectionToken Pruning

  15. Evolving Layer-Specific Scalar Functions for Hardware-Aware Transformer Adaptation

    May 13, 2026Kieran Carrigg, Sigur de Vries, Amirhossein Sadough +1Efficient Neural Network InferenceEfficient ViTs

  16. Do Vision Transformers Need All-to-All Attention? Global Communication Through Elastic Learned Cores

    May 12, 2026Alan Z. Song, Yinjie Chen, Mu Nan +3Visual Representation LearningVision Transformer

  17. DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers

    May 12, 2026Kaixuan He, Song Chen, Yi KangEfficient ViTsVisual Token Merging

  18. Breaking Global Self-Attention Bottlenecks in Transformer-based Spiking Neural Networks with Local Structure-Aware Self-Attention

    May 12, 2026Lingdong Li, Hangming Zhang, Qiang YuSpiking TransformersEfficient ViTs

  19. Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction

    May 12, 2026Haoyu Zhang, Zeyu Zhang, Zedong Zhou +2Quantization-Aware Training3D Reconstruction

  20. RelFlexformer: Efficient Attention 3D-Transformers for Integrable Relative Positional Encodings

    May 11, 2026Byeongchan Kim, Arijit Sehanobish, Avinava Dubey +23D ViTsSelf-Attention

  21. Investigating Single-Block Recurrence in Vision Transformers for Image Recognition

    May 11, 2026Michal Byra, Pawel Olszowiec, Grzegorz Stefanski +2Vision TransformerRecurrent Transformers

  22. MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers

    May 11, 2026Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu +2Energy-Efficient MLEdge Inference

  23. PrePARE: Pre-AA Token Pruning for Frozen Multi-View Geometry Transformers

    May 8, 2026Haotang Li, Zhenyu Qi, Shaohan Henry Wang +5Multi-View GeometryEfficient ViTs

  24. An Efficient Token Compression Framework for Visual Object Tracking

    May 8, 2026Weijing Wu, Qihua Liang, Bineng Zhong +3Visual Object TrackingEfficient ViTs

  25. SAFformer:Improving Spiking Transformer via Active Predictive Filtering

    May 8, 2026Zequan Xie, Weiming Zeng, Yunhua Chen +3Spiking TransformersEfficient ViTs

  26. LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute

    May 7, 2026Ali Salamatian, Anthony Fuller, Pritam Sarkar +3Efficient ViTsVideo Action Recognition

  27. Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction

    May 7, 2026Zecheng Tang, Jiaye Fu, Qiankun Gao +53D ReconstructionEfficient ViTs