Efficient Transformer Inference

Latest papers 79

All topics
CardsList
  1. ResidualQuant: KV Cache Quantization for Looped Transformers with 2-Bit Residuals

    Oct 7, 2026Heejun Kim, Junyoung Lee, SangLyul Cho +3KV-Cache QuantizationEfficient Transformer Inference

  2. QCATS: Query Context-Aware Transformer Slicing for Efficient Predictive Query Processing

    Oct 7, 2026Yueying Li, Zhongle Xie, Ke Chen +1Efficient Transformer InferenceConditional Computation

  3. Efficient World Action Model Inference with Adaptive Intermediate States

    Sep 28, 2026Zhinnan Liu, Haozhi Han, Ruge Zhang +8Efficient Transformer InferenceWorld Model-Based Planning

  4. Approximating Softmax in Pretrained LLMs: Model Sensitivity and Kernel Acceleration

    Sep 27, 2026Shangzhen Zhu, Muyan Hu, Tomasz KozlowskiEfficient Transformer InferenceSoftmax Attention

  5. FlashLoop: Fast and Memory-Efficient Looped Transformers via Lazy Updates

    Sep 24, 2026Wanqi Yang, Shiwei LiuEfficient Transformer InferenceRecurrent Transformers

  6. LoopSpec: Pipelined Self-Speculative Decoding for Looped Transformers

    Sep 15, 2026SangLyul Cho, Langqing Cui, Sehoon Kim +2Efficient Transformer InferenceSpeculative Decoding

  7. Attention Quantization for Tabular Foundation Models

    Sep 14, 2026Jonas M. Kübler, Benjamin Jäger, Klemens Flöge +2Efficient Transformer InferenceTabular Foundation Models

  8. EFQ-Softmax: Exp-Free Quantization for Softmax

    Sep 9, 2026Haohui Han, Yuming Wan, Hongni Wang +4Efficient Transformer InferenceTransformer Attention

  9. Dense Structural Compression of Transformers via Gauge-Correct Channel Removal

    Sep 7, 2026Jed A. Duersch, Naïm Es-Sebbani, Nathanaël Haas +1Efficient Transformer InferenceStructured Pruning

  10. Recent Developments in Transformer Inference Deployment on FPGA Platforms: A Survey

    Sep 1, 2026Arjan Blankestijn, Uraz Odyurt, Amirreza YousefzadehEfficient Transformer InferenceTransformer Inference

  11. ZIPBrain: Can EEG Foundation Models Be Faster, Locally Deployable, but Accurate?

    Aug 7, 2026Lingwei Li, Yirong Kan, Peng Chen +3Efficient Transformer InferenceToken Merging

  12. MOSAIC: Masked Outsourcing of Secure AI Computations

    Jul 31, 2026James Hsin-yu Chiang, Sheila Zingg, Kari Kostiainen +1Efficient Transformer InferenceSecure Multi-Party Computation

  13. S-CEReBrO: Breaking the Memory Barrier in Continuous EEG Monitoring

    Jul 30, 2026Glenn Anta Bucagu, Thorir Mar Ingolfsson, Yawei Li +1Efficient Transformer InferenceElectroencephalography

  14. MDTransformer: A Hardware-Software Co-Design of Mode-Division Photonic Transformer Accelerator with Inverse-Designed Coherent Crossbar

    Jul 28, 2026Solomon Micheal Serunjogi, Rachmad Vidya Wicaksana Putra, Ayat Taha +2Efficient Transformer InferencePhotonic Computing

  15. Enabling Fully Integer-Only Inference for Lightweight Detection Transformers

    Jul 27, 2026Thanh Cong Le, Michal Szczepanski, Martyna PorebaEfficient Transformer InferenceEfficient Inference

  16. ATLAS: Automated Approximation of Transformers for Efficient Homomorphic Inference in One Hour

    Jul 26, 2026Jianhang Xie, Sicheng Tan, Vishnu Naresh Boddeti +1Efficient Transformer InferenceHomomorphic Encryption

  17. CausalGate: Causal Importance Distillation for Transformer Module Pruning

    Jul 21, 2026Kiran Nair, Smriti Regmi, Rodrigue RizkEfficient Transformer InferenceLLM Pruning

  18. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  19. NIFA: Nonlinear IMC enhanced FPGA for efficient ML inference

    Jul 16, 2026Jiajun Hu, Ruthwik Reddy Sunketa, Lei Zhao +3Efficient Transformer InferenceCompute-in-Memory

  20. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuEfficient Transformer InferenceGPU Kernel Optimization

  21. Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous Vehicles

    Jul 12, 2026Ashiyana Abdul Majeed, Mahmoud Meribout, Neethu Joseph +2Efficient Transformer InferenceEdge Inference

  22. STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

    Jul 10, 2026Victor J. B. Jung, Gagandeep Singh, Joseph Melber +3Efficient Transformer InferenceEnergy-Efficient ML