Efficient Transformer Inference

Latest papers 79

All topics
CardsList
  1. Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers

    Jul 6, 2026Ligong Han, Kai Xu, Hao Wang +3Efficient Transformer InferenceTransformer Inference

  2. SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

    Jul 3, 2026Jianing Deng, Yuanzhe Li, Jialu Wang +4Efficient Transformer Inference3D ViTs

  3. NPUsper: Eliminating Redundant Computation for Real-Time Whisper on Mobile NPUs

    Jul 1, 2026Sihyeon Lee, Hojeong Lee, Sungwon Woo +3Efficient Transformer InferenceStreaming ASR

  4. HEPTv2: End-to-End Efficient Point Transformer for Charged Particle Reconstruction

    Jun 18, 2026Siqi Miao, Shitij Govil, Jack P. Rodgers +5Efficient Transformer InferenceTransformer

  5. LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

    Jun 16, 2026Jian Yang, Shawn Guo, Wei Zhang +16Efficient Transformer InferenceTest-Time Scaling

  6. Reconfigurable Computing Challenge: Transformer for Jet Tagging on Versal AI Engines

    Jun 16, 2026Gram Koski, Sean Lipps, Zhenghua Ma +2Efficient Transformer InferenceEfficient Neural Network Inference

  7. Otters++: A Time-to-first-spike Based Energy Efficient Optical Spiking Transformer

    Jun 11, 2026Zhanglu Yan, Jiayi Mao, Kaiwen Tang +6Efficient Transformer InferenceSpiking Transformers

  8. TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

    Jun 8, 2026Yejin Lee, Junwon Moon, Hyoeun Kim +3Efficient Transformer InferenceAudio Token Compression

  9. When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

    Jun 4, 2026Luoming Zhang, Yuwei Ren, Kui Zhang +7Efficient Transformer InferenceLLM Inference Acceleration

  10. AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference

    Jun 4, 2026Xuanzhe Li, Ziyan Weng, Zhiyu Zhu +1Efficient Transformer InferenceGPU Acceleration

  11. Depth-Attention: Cross-Layer Value Mixing for Language Models

    Jun 3, 2026Boyi Zeng, Yiqin Hao, Zitong Wang +7Efficient Transformer InferenceDecoder-Only Language Models

  12. Operator Fusion for LLM Inference on the Tensix Architecture

    Jun 3, 2026Qingbo Wu, Ke Li, Wenzhu Wang +3Efficient Transformer InferenceAI Accelerator Inference

  13. DxPTA: An Architecture Design Space Exploration with Optical Dataflow-guided Strategy for HW/SW Co-Design of Photonic Transformer Accelerators

    Jun 2, 2026Rachmad Vidya Wicaksana Putra, Solomon Micheal Serunjogi, Mahmoud Rasras +1Efficient Transformer InferenceHardware-Software Co-Design

  14. Do Transformers Need Three Projections? Systematic Study of QKV Variants

    Jun 1, 2026Ali Kayyam, Anusha Madan Gopal, M Anthony LewisEfficient Transformer InferenceTransformer Attention

  15. JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

    May 26, 2026Dongyun Zou, Zhuoyang Zhang, Junyu Chen +8Efficient Transformer InferenceVision Foundation Models

  16. Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment

    May 25, 2026Muhammad Azlan Qazi, Alexandros Iosifidis, Qi ZhangEfficient Transformer InferenceTransformer Inference

  17. Fast and Stable Triangular Inversion for Delta-Rule Linear Transformers

    May 20, 2026Aleksandros Sobczyk, Gioele Gottardo, Christos K. Matzoros +4Efficient Transformer InferenceAI Accelerator Inference

  18. LT2: Linear-Time Looped Transformers

    May 20, 2026Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu +4Efficient Transformer InferenceRecurrent Transformers

  19. SparseSAM: Structured Sparsification of Activations in Segment Anything Models

    May 17, 2026Hoai-Chau Tran, Chi H. Nguyen, Duy M. H. Nguyen +3Efficient Transformer InferenceImage Segmentation

  20. Block-Based Double Decoders

    May 11, 2026Asher Labovich, Benjamin Bradley, Vanessa Alexander +1Efficient Transformer InferenceLLM Inference Acceleration

  21. FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast

    May 8, 2026Wenhao Wu, Zishan Shao, Kangning Cui +5Efficient Transformer InferenceLLM Compression