Efficient ViTs

ViT: Vision Transformer

Momentum

20 papers in the last four weeks, up 300% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 152

All topics
CardsList
  1. LUMA: Benchmarking Segmentation via a Lightweight Universal Mask Adapter

    Jul 1, 2026Tobias Christian Nauen, Anosh Billimoria, Federico Raue +3Efficient ViTsSemantic Segmentation

  2. FlexViT: A Flexible FPGA-based Accelerator for Edge Vision Transformers

    Jun 30, 2026Hubert Dymarkowski, Xingjian Fu, Rappy Saha +2Hybrid CNN-Transformer ArchitecturesEdge Inference

  3. REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction

    Jun 30, 2026Chanjong Im, Sebastian Diem, Thomas MandlEfficient ViTsVisual Token Pruning

  4. RenderFormer++: Scalable and Physically Grounded Feed-Forward Neural Rendering

    Jun 29, 2026Huangsheng Du, Haoran Zhu, Youcheng Cai +2Neural RenderingEfficient ViTs

  5. TuringViT: Making SOTA Vision Transformers Accessible to All

    Jun 23, 2026Qiman Wu, Hanlin Chen, Lyujie Chen +19Vision Foundation ModelsVision Transformer

  6. FrequencyFormer: A Co-Designed Sensor-to-Processor Pipeline for Frequency-Domain Vision Transformer Inference

    Jun 17, 2026Chengwei Zhou, Ovishake Sen, Xuming Chen +5Edge InferenceEfficient ViTs

  7. Dyna-DINO: Efficient ViT Distillation Via Adaptive Representation Anchoring

    Jun 17, 2026Jiaqi Zhang, Ashton Lee, Anthony Wong +3Efficient ViTsCurriculum Learning

  8. RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

    Jun 16, 2026Jinhao You, Shuo Lyu, Zhuohang Lyu +53D ViTsMulti-View 3D Reconstruction

  9. RT-Counter: Real-Time Text-Guided Open-Vocabulary Object Counting

    Jun 16, 2026Hao-Yuan Ma, Li Zhang, Zhiwei Zhu +1Object CountingEfficient ViTs

  10. EdgeZSAD: Practical Zero-Shot Anomaly Detection on Edge Devices

    Jun 15, 2026Taewan Cho, Andrew Jaeyong ChoiEdge InferenceIndustrial Anomaly Detection

  11. ViT-FREE: Efficient Face Recognition via Early Exiting and Synthetic Adaptation

    Jun 10, 2026Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira +2Inference-Time OptimizationEfficient ViTs

  12. Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

    Jun 8, 2026Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont +1Vision TransformerEfficient ViTs

  13. Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning

    Jun 7, 2026Chiradeep Ghosh, Dakshina Ranjan KiskuImage CaptioningVision Transformer

  14. NGram-MoSE: Efficient Remote Sensing Super-Resolution via N-Gram Context and Mixture-of-Experts

    Jun 7, 2026Yun-Hsuan Huang, Trong-An Bui, Chih-Hung ChuangOOD GeneralizationRemote Sensing Image Super-Resolution

  15. RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT

    Jun 6, 2026Kyumin Choi, Ikbeom JangVision TransformerEfficient ViTs

  16. ATT-CR: Adaptive Triangular Transformer for Cloud Removal

    Jun 4, 2026Yang Wu, Ye Deng, Pengna Li +4Remote SensingTransformer Attention

  17. UtVAA: Ultra-tiny Vision Transformer with Affix Attention for Mobile Image Classification

    Jun 2, 2026Romiyal George, Sathiyamohan Nishankar, Selvarajah Thuseethan +1Vision TransformerEdge Inference

  18. Efficient Transformer-Based Localized Patch Sampling for Choroid Plexus Segmentation in Multiple Sclerosis

    Jun 2, 2026Po-Jui Lu, Alessandro Cagol, Mario Ocampo-Pineda +12Efficient ViTsMagnetic Resonance Imaging

  19. PSViT: A Methodology for Structurally Pruning Spiking Vision Transformers

    Jun 2, 2026Rachmad Vidya Wicaksana Putra, Achyuta Muthuvelan, Alberto Marchisio +1Efficient ViTsSpiking Neural Networks

  20. LALE: Lightweight-Transformer Architecture for Land-Cover Estimation

    Jun 1, 2026Ümit Mert Çağlar, Alptekin TemizelRemote Sensing Image SegmentationHybrid CNN-Transformer Architectures

  21. hZACH-ViT: Curved Latent Geometry for Compact Vision Transformers in Low-Data Medical Imaging

    May 30, 2026Athanasios AngelakisGeometric Representation LearningEfficient ViTs

  22. Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

    May 30, 2026Yitong Jiang, Hongjun Wang, Collin McCarthy +15GPU Kernel OptimizationVision Foundation Models

  23. FSM-Net: An Efficient Frequency-Spatial Network for Real-World Deblurring

    May 29, 2026Vinh-Thuan LyImage DeblurringFrequency-Domain Image Processing

  24. SwInception -- Local Attention Meets Convolutions

    May 28, 2026David Hagerman, Roman Naeem, Jakob Lindqvist +3Hybrid CNN-Transformer ArchitecturesEfficient ViTs

  25. Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid

    May 27, 2026Krishna Kumar Sharma, Somdyuti PaulEfficient Neural Network InferenceHybrid CNN-Transformer Architectures

  26. Recursive Vision Transformer with Dynamic Depth and Width Adjustment for Resource-Efficient Image Semantic Communication

    May 27, 2026Zhilong Zhang, Xinhui Zhang, Gongyu Jin +3Dynamic Neural NetworksSemantic Communication

  27. Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking

    May 27, 2026Hongtao Yang, Bineng Zhong, Qihua Liang +4Visual Object TrackingEfficient ViTs

  28. JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

    May 26, 2026Dongyun Zou, Zhuoyang Zhang, Junyu Chen +8Efficient Transformer InferenceVision Foundation Models

  29. AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

    May 26, 2026Semi Lee, Hyejin Go, Hyesong ChoiToken MergingSelf-Attention

  30. Event-to-Video Reconstruction using Spatio-Temporal and Frequency-Enhanced Deep Neural Networks

    May 25, 2026Ramna Maqsood, Paulo Nunes, Luís Ducla Soares +1Event-Based VisionVision Transformer