Efficient Transformer Inference

Latest papers 79

All topics
CardsList
  1. Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

    May 7, 2026Yongyi Wang, Hanyu Liu, Lingfeng Li +6Efficient Transformer InferenceReinforcement Learning

  2. Linearizing Vision Transformer with Test-Time Training

    May 4, 2026Yining Li, Dongchen Han, Zeyu Liu +3Efficient Transformer InferenceSelf-Attention

  3. LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference

    May 1, 2026Shashank Kapadia, Deep Naryan Mishra, Sujal Reddy Alugubelli +4Efficient Transformer InferenceDynamic Neural Networks

  4. ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

    Apr 26, 2026Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao +1Efficient Transformer InferenceSoftmax Attention

  5. Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

    Apr 25, 2026Divakar Kumar Yadav, Tian Zhao, Deepak KumarEfficient Transformer InferenceGPU Kernel Optimization

  6. The Recurrent Transformer: Greater Effective Depth and Efficient Decoding

    Apr 23, 2026Costin-Andrei Oncescu, Depen Morwani, Samy Jelassi +3Efficient Transformer InferenceSelf-Attention

  7. Decoding Text Spans for Efficient and Accurate Named-Entity Recognition

    Apr 22, 2026Andrea Maracani, Savas Ozkan, Junyi Zhu +2Efficient Transformer InferenceNamed Entity Recognition

  8. EX-FIQA: Leveraging Intermediate Early eXit Representations from Vision Transformers for Face Image Quality Assessment

    Apr 21, 2026Guray Ozgur, Tahar Chettaoui, Eduarda Caldeira +4Efficient Transformer InferenceEfficient Inference

  9. Depth Adaptive Efficient Visual Autoregressive Modeling

    Apr 19, 2026Chunliang Li, Tianze Cao, Sanyuan ZhaoEfficient Transformer InferenceVisual Autoregressive Models

  10. SecureRouter: Encrypted Routing for Efficient Secure Inference

    Apr 16, 2026Yukuan Zhang, Mengxin Zheng, Qian LouEfficient Transformer InferenceSecure Multi-Party Computation

  11. Dispatch-Aware Ragged Attention for Pruned Vision Transformers

    Apr 16, 2026Seifeldin Abdellatif, Ahmad AlmasriEfficient Transformer InferenceVisual Attention

  12. Revisiting the Shape Convention of Transformer Language Models

    Feb 6, 2026Feng-Ting Liao, Guan-Ting Yi, Tzu-Quan Lin +2Efficient Transformer InferenceTransformer FFNs

  13. Transform Trained Transformer for Accelerating Native 4K Video Generation

    Dec 15, 2025Jiangning Zhang, Junwei Zhu, Teng Hu +9Efficient Transformer InferenceEfficient Attention

  14. Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

    Dec 2, 2025Hong-Jie You, Jie-Jing Shao, Xiao-Wen Yang +3Efficient Transformer InferenceSelf-Supervised Pre-Training

  15. Controllably Efficient Language Models

    Nov 7, 2025Jatin Prakash, Aahlad Puli, Rajesh RanganathEfficient Transformer InferenceLong-Context Language Modeling