Efficient ViTs

ViT: Vision Transformer

Momentum

20 papers in the last four weeks, up 300% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 152

All topics
CardsList
  1. Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging

    May 3, 2026Phat Nguyen, Xue Geng, Kaixin Xu +3Efficient Neural Network InferenceEfficient ViTs

  2. Linear-Time Global Visual Modeling without Explicit Attention

    May 3, 2026Ruize He, Dongchen Han, Gao HuangTransformerTransformer Attention

  3. Efficient Spatio-Temporal Vegetation Pixel Classification with Vision Transformers

    Apr 30, 2026Alan Gomes, Anderson Gonçalves, Samuel Felipe dos Santos +6Agricultural Remote SensingVision Transformer

  4. QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention

    Apr 28, 2026Sehyeon Oh, Yongin Kwon, Jemin LeeSoftmax AttentionGPU Acceleration

  5. PointTransformerX: Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms

    Apr 27, 2026Laurenz Reichardt, Nikolas Ebert, Oliver WasenmüllerRotary Positional Embeddings3D ViTs

  6. ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

    Apr 26, 2026Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao +1Efficient Transformer InferenceSoftmax Attention

  7. BSViT: A Burst Spiking Vision Transformer for Expressive and Efficient Visual Representation Learning

    Apr 25, 2026Hongxiang Peng, Dewei Bai, Hong QuSpiking TransformersEfficient ViTs

  8. UHR-DETR: Efficient End-to-End Small Object Detection for Ultra-High-Resolution Remote Sensing Imagery

    Apr 23, 2026Jingfang Li, Haoran Zhu, Wen Yang +4Remote Sensing Small Object DetectionSmall Object Detection

  9. Self-supervised pretraining for an iterative image size agnostic vision transformer

    Apr 22, 2026Nedyalko Prisadnikov, Danda Pani Paudel, Yuqian Fu +1Self-Supervised Pre-TrainingVision Transformer

  10. LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

    Apr 22, 2026Zhe Feng, Sen Lian, Changwei Wang +5Efficient ViTsEfficient Attention

  11. RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation

    Apr 21, 2026Ahmed Marouane Djouamaa, Abir Belaala, Abdellah Zakaria Sellam +3Image SegmentationVision Transformer

  12. Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing

    Apr 21, 2026Mika Feng, Pierre Gallin-Martel, Koichi Ito +1Vision Foundation ModelsDomain Generalization

  13. Advancing Vision Transformer with Enhanced Spatial Priors

    Apr 20, 2026Qihang Fan, Huaibo Huang, Mingrui Chen +2Vision TransformerTransformer Attention

  14. ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

    Apr 20, 2026Clayton Fields, Casey KenningtonVision-Language ModelsEfficient ViTs

  15. CATP: Confidence-Aware Token Pruning for Camouflaged Object Detection

    Apr 18, 2026Yuhan Gao, Shuhao Kang, Xin He +3Token PruningEfficient ViTs

  16. SSFT: A Lightweight Spectral-Spatial Fusion Transformer for Generic Hyperspectral Classification

    Apr 17, 2026Alexander Musiat, Nikolas Ebert, Oliver WasenmüllerRepresentation LearningHyperspectral Imaging

  17. StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression

    Apr 16, 2026Xuanyi Liu, Chunan Yu, Deyi Ji +63D ViTsStreaming 3D Reconstruction

  18. Dispatch-Aware Ragged Attention for Pruned Vision Transformers

    Apr 16, 2026Seifeldin Abdellatif, Ahmad AlmasriEfficient Transformer InferenceVisual Attention

  19. Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection

    Apr 16, 2026Yangchen Zeng, Zhenyu Yu, Dongming Jiang +5Small Object DetectionEfficient Object Detection

  20. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

    Apr 16, 2026Mingqian Ji, Shanshan Zhang, Jian YangMulti-View 3D Object DetectionEfficient ViTs

  21. PDE-SSM: A Spectral State Space Approach to Spatial Mixing in Diffusion Transformers

    Mar 14, 2026Eshed Gal, Moshe Eliasof, Eldad HaberDiffusion TransformerVisual SSMs

  22. HiAP: A Multi-Granular Stochastic Auto-Pruning Framework for Vision Transformers

    Mar 12, 2026Andy Li, Aiden Durrant, Milan Markovic +1Efficient ViTsAttention Head Pruning

  23. StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models

    Mar 7, 2026Duy M. H. Nguyen, Tuan A. Tran, Duong Nguyen +17Token MergingImage Segmentation

  24. AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

    Feb 18, 2026David Smerkous, Zian Wang, Behzad NajafianMasked AutoencodersSelf-Supervised Pre-Training

  25. From Local Windows to Adaptive Candidates via Individualized Exploratory: Rethinking Attention for Image Super-Resolution

    Jan 13, 2026Chunyu Meng, Wei Long, Shuhang GuEfficient ViTsSparse Attention

  26. Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers

    Jul 21, 2025Ian Chuang, Jinyu Zou, Andrew Lee +2Visuomotor Policy LearningEfficient ViTs

  27. GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers

    Jun 13, 2025Guang Liang, Xinyao Liu, Jianxin WuQuantization-Aware Training4-Bit Quantization

  28. Fast and Accurate Image Restoration and Generation with Rank Enhanced Linear Attention

    May 22, 2025Yuang AiEfficient ViTsLinear Attention