Efficient ViTs

ViT: Vision Transformer

Momentum

20 papers in the last four weeks, up 300% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 152

All topics
CardsList
  1. Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction

    Aug 9, 2026Aya Manel Zitouni, Aicha Zenakhri, Karim Haroun +1Efficient ViTsFacial Expression Recognition

  2. Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

    Aug 8, 2026Uri Z. Kialy, Gil Ben-ArtziFine-TuningVision Foundation Model Adaptation

  3. AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection

    Aug 8, 2026Xu Zhang, Xinqing Li, Jianpeng Xie +3Vision Foundation Model AdaptationRemote Sensing Change Detection

  4. HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

    Aug 7, 2026Dong Liu, Yanxuan Yu, Renata Borovica-Gajic +2Efficient ViTsLinear Attention

  5. CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition

    Aug 7, 2026Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu +3Edge InferenceEfficient ViTs

  6. A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization

    Aug 5, 2026Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay +1Adversarial Patch AttacksAdversarial Attacks

  7. Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

    Aug 4, 2026Yang Bai, Linyuan Wang, Haoyang Jiang +3Vision TransformerEfficient ViTs

  8. DeVIT: Low-Power Vision Transformer Acceleration Using Delta Computation

    Aug 2, 2026Reyhaneh Hosseinzadeh, Parham Zilouchian Moghaddam, Mehdi ModarressiEfficient ViTs

  9. Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers

    Jul 31, 2026Kamil Książek, Piotr Suszyński, Michał Jan Włodarczyk +2Transformer InterpretabilityAttention Head Analysis

  10. MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

    Jul 30, 2026Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixed-Precision QuantizationVision Transformer

  11. WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing

    Jul 28, 2026Prathyush Sajith, Emadeldeen Hamdan, Ahmet Enis CetinDepth EstimationStereo Matching

  12. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Jul 25, 2026Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4Vision-Language ModelsEfficient VLM Inference

  13. BMFA: Boundary-Minority Free-Energy Adaptive Screening

    Jul 20, 2026Wenyan Xu, Alizer WongSoftmax AttentionVision Transformer

  14. Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection

    Jul 20, 2026Amir Hosein Fadaei, Mahyar Maleki, Mohammad-Reza A. DehaqaniTransformerEfficient ViTs

  15. Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model

    Jul 19, 2026Xiao Wang, Hao Si, Qiang Chen +8Neural Surrogate ModelingTransformer

  16. DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

    Jul 17, 2026Jehun Kang, Jungha Wang, Youngjun Hwang +1Multi-Task LearningMulti-Scale Feature Fusion

  17. Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

    Jul 17, 2026Tong Jin, Yunpeng Liu, Shuyu Hu +4Visual Place RecognitionEfficient ViTs

  18. VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

    Jul 16, 2026Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu +3Efficient ViTsEfficient Attention

  19. Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous Vehicles

    Jul 12, 2026Ashiyana Abdul Majeed, Mahmoud Meribout, Neethu Joseph +2Efficient Transformer InferenceEdge Inference

  20. Foveation-Guided Dynamic Token Selection for Robust and Efficient Vision Transformers

    Jul 10, 2026Ibrahim Batuhan Akkaya, Kishaan Jeeveswaran, Bahram Zonooz +1Image Corruption RobustnessEfficient ViTs

  21. Subtoken Vision Transformer for Fine-grained Recognition

    Jul 10, 2026Jie Zhu, Ivy Zhang, Minchul Kim +1Vision TransformerVisual Tokenization

  22. Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

    Jul 4, 2026Zhenfeng Su, Kang Zhao, Han Bao +4Vision TransformerEfficient ViTs

  23. LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning

    Jul 3, 2026Licheng Zhang, Siew-Kei Lam, Naveed AkhtarRemote Sensing Image UnderstandingImage Captioning

  24. Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction

    Jul 2, 2026Janet Wang, Yunbei Zhang, Lin Zhao +3Efficient ViTsDense Prediction

  25. When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression

    Jul 2, 2026Tien-Phat Nguyen, Ngai-Man CheungDistribution Shift RobustnessVision Transformer

  26. Diversity-aware View Partitioning for Scalable VGGT

    Jul 2, 2026Jinsoo Park, Donggyu Choi, Ahyun Seo +23D ViTsMulti-View 3D Reconstruction

  27. Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers

    Jul 1, 2026Aravind Pradeep, Samira Nazari, Mahdi Taheri +1Token MergingEfficient ViTs

  28. SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference

    Jul 1, 2026Kyan Mahajan, Mohammad SaqlainImage TokenizationEfficient ViTs

  29. Soft Mixture-of-Recursions: Going Deeper with Recursive Vision Transformers

    Jul 1, 2026Sang In Lee, Jihun ParkVision TransformerRecurrent Transformers