Efficient ViTs

ViT: Vision Transformer

Momentum

27 papers in the last four weeks, up 59% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

    Jun 8, 2026Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont +1Vision TransformerEfficient ViTs

  2. Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning

    Jun 7, 2026Chiradeep Ghosh, Dakshina Ranjan KiskuImage CaptioningVision Transformer

  3. NGram-MoSE: Efficient Remote Sensing Super-Resolution via N-Gram Context and Mixture-of-Experts

    Jun 7, 2026Yun-Hsuan Huang, Trong-An Bui, Chih-Hung ChuangOOD GeneralizationRemote Sensing Image Super-Resolution

  4. RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT

    Jun 6, 2026Kyumin Choi, Ikbeom JangVision TransformerEfficient ViTs

  5. ATT-CR: Adaptive Triangular Transformer for Cloud Removal

    Jun 4, 2026Yang Wu, Ye Deng, Pengna Li +4Remote SensingTransformer Attention

  6. UtVAA: Ultra-tiny Vision Transformer with Affix Attention for Mobile Image Classification

    Jun 2, 2026Romiyal George, Sathiyamohan Nishankar, Selvarajah Thuseethan +1Vision TransformerEdge Inference

  7. Efficient Transformer-Based Localized Patch Sampling for Choroid Plexus Segmentation in Multiple Sclerosis

    Jun 2, 2026Po-Jui Lu, Alessandro Cagol, Mario Ocampo-Pineda +12Efficient ViTsMagnetic Resonance Imaging

  8. PSViT: A Methodology for Structurally Pruning Spiking Vision Transformers

    Jun 2, 2026Rachmad Vidya Wicaksana Putra, Achyuta Muthuvelan, Alberto Marchisio +1Efficient ViTsSpiking Neural Networks

  9. LALE: Lightweight-Transformer Architecture for Land-Cover Estimation

    Jun 1, 2026Ümit Mert Çağlar, Alptekin TemizelRemote Sensing Image SegmentationHybrid CNN-Transformer Architectures

  10. hZACH-ViT: Curved Latent Geometry for Compact Vision Transformers in Low-Data Medical Imaging

    May 30, 2026Athanasios AngelakisGeometric Representation LearningEfficient ViTs

  11. Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

    May 30, 2026Yitong Jiang, Hongjun Wang, Collin McCarthy +15GPU Kernel OptimizationVision Foundation Models

  12. FSM-Net: An Efficient Frequency-Spatial Network for Real-World Deblurring

    May 29, 2026Vinh-Thuan LyImage DeblurringFrequency-Domain Image Processing

  13. SwInception -- Local Attention Meets Convolutions

    May 28, 2026David Hagerman, Roman Naeem, Jakob Lindqvist +3Hybrid CNN-Transformer ArchitecturesEfficient ViTs

  14. Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid

    May 27, 2026Krishna Kumar Sharma, Somdyuti PaulEfficient Neural Network InferenceHybrid CNN-Transformer Architectures

  15. Recursive Vision Transformer with Dynamic Depth and Width Adjustment for Resource-Efficient Image Semantic Communication

    May 27, 2026Zhilong Zhang, Xinhui Zhang, Gongyu Jin +3Dynamic Neural NetworksSemantic Communication

  16. Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking

    May 27, 2026Hongtao Yang, Bineng Zhong, Qihua Liang +4Visual Object TrackingEfficient ViTs

  17. JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

    May 26, 2026Dongyun Zou, Zhuoyang Zhang, Junyu Chen +8Efficient Transformer InferenceVision Foundation Models

  18. AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

    May 26, 2026Semi Lee, Hyejin Go, Hyesong ChoiToken MergingSelf-Attention

  19. Event-to-Video Reconstruction using Spatio-Temporal and Frequency-Enhanced Deep Neural Networks

    May 25, 2026Ramna Maqsood, Paulo Nunes, Luís Ducla Soares +1Event-Based VisionVision Transformer

  20. Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

    May 22, 2026Shuhong Zheng, Michael Oechsle, Erik Sandström +33D ViTsMulti-View 3D Reconstruction

  21. Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models

    May 22, 2026Maxim Henry, Adrien Deliège, Sébastien Piérard +1Deep Learning OptimizationEfficient ViTs

  22. ASAP: Attention Sink Anchored Pruning

    May 21, 2026Jaehyuk Lee, Hanyoung Kim, Yanggee Kim +1Self-AttentionEfficient ViTs

  23. Accelerating Vision Foundation Models with Drop-in Depthwise Convolution

    May 21, 2026Carmelo Scribano, Mohammad Mahdi, Nedyalko Prisadnikov +5Vision Foundation ModelsVision Foundation Model Adaptation

  24. Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments

    May 20, 2026Van Quang NguyenImage CaptioningEfficient ViTs

  25. Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning

    May 19, 2026Zichao Zeng, June Moh Goo, Junwei Zheng +4Visual Place RecognitionEfficient ViTs

  26. LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift

    May 18, 2026Haozhe Si, Yuxuan Wan, Yuqing Wang +2Representation LearningMasked Autoencoders

  27. Token-Space Mask Prediction for Efficient Vision Transformer Segmentation

    May 18, 2026Calvin Galagain, Martyna Poreba, François GouletteVision TransformerEfficient ViTs

  28. SparseSAM: Structured Sparsification of Activations in Segment Anything Models

    May 17, 2026Hoai-Chau Tran, Chi H. Nguyen, Duy M. H. Nguyen +3Efficient Transformer InferenceImage Segmentation

  29. Systematic Evaluation of Vision Transformers for Automated Cervical Cancer Classification: Optimization, Statistical Validation, and Clinical Interpretability

    May 17, 2026Nisreen Albzour, Sarah S. LamVision TransformerEfficient ViTs

  30. From Sparsity to Simplicity: Enabling Simpler Sequential Replacements via Sparse Attention Distillation

    May 15, 2026Yuxin Ren, Maxwell D Collins, Miao Hu +1Self-AttentionVision Transformer