Transformer Inference

Momentum

4 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 39

All topics
CardsList
  1. Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2

    Oct 1, 2026Yohan Chatelain, Pablo de Oliveira CastroTransformer InferenceLow-Bit Quantization

  2. The Geometry of Inference in Transformer Residual Streams

    Sep 29, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer InterpretabilityTransformer Inference

  3. A Smaller Transformer in Your Transformer

    Sep 17, 2026Dhananjay Tomar, Marius Aasan, Andreas Kleppe +1Transformer InferenceVision Transformer

  4. Recent Developments in Transformer Inference Deployment on FPGA Platforms: A Survey

    Sep 1, 2026Arjan Blankestijn, Uraz Odyurt, Amirreza YousefzadehEfficient Transformer InferenceTransformer Inference

  5. CacheBridge: Efficient Cross-Model KV Cache Transfer

    Sep 1, 2026Xingyu Qu, Siyuan Lu, Zhiyu Chen +2Transformer InferenceKV Caching

  6. The Transformer Revolution, Part 1: Dynamic Processing through Output-Weight Interconnections

    Aug 4, 2026Marco Giunti, Fabrizia Giulia GaravagliaTransformer InferencePrompt Sensitivity

  7. At-the-Roofline Sparse Tensor Contractions on Vector Processors for Transformer Inference

    Jul 28, 2026Bowen Wang, Chi Zhang, Diyou Shen +3Efficient Neural Network InferenceTransformer Inference

  8. Agree on the Model, Verify the Inference: GKR Protocols for HND-Based Transformer Inference

    Jul 23, 2026Xiaolong Liang, Juanjuan Li, Rui Qin +1Neural Network VerificationTransformer Inference

  9. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  10. On the Diverse Dynamical Behaviors Arising in Deep Linear Transformers

    Jul 20, 2026Sixu Li, Thomas Jacob Maranzatto, Jan Peszek +5Dynamical SystemsTransformer Inference

  11. Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers

    Jul 6, 2026Ligong Han, Kai Xu, Hao Wang +3Efficient Transformer InferenceTransformer Inference

  12. ELiTeFormer: An Efficient Transformer for FPGAs

    Jul 4, 2026Victor Agostinelli, Nicolas Bohm Agostini, Antonino TumeoLLM QuantizationTernary Quantization

  13. The risk of KV cache compression

    Jul 1, 2026Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno +2Transformer InferenceKV Caching

  14. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

    Jun 20, 2026Xin GaoTransformer InferenceKV Caching

  15. MemNovo: Look Back at the Spectrum for Balanced De Novo Peptide Sequencing from Mass Spectrometry

    Jun 10, 2026Dongxin Lyu, Jingbo Zhou, Hongxin Xiang +2Memory-Augmented Neural NetworksTransformer Inference

  16. Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior

    May 26, 2026Zeyi Huang, Xuehai He, LiLiang Ren +8Language Model PretrainingTransformer Inference

  17. Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment

    May 25, 2026Muhammad Azlan Qazi, Alexandros Iosifidis, Qi ZhangEfficient Transformer InferenceTransformer Inference

  18. Training-Free Looped Transformers

    May 22, 2026Lizhang Chen, Jonathan Li, Chen Liang +2Transformer InferenceRecurrent Transformers

  19. SNLP: Layer-Parallel Inference via Structured Newton Corrections

    May 18, 2026Ligong Han, Kai Xu, Hao Wang +1Transformer InferenceParallel Decoding

  20. Transformer-like Inference from Optimal Control

    May 15, 2026Aditya Kudre, Heng-Sheng Chang, Prashant G. MehtaTransformer InferenceDecoder-Only Language Models

  21. Transformer Scalability Crisis: The First Comprehensive Empirical Analysis of Performance Walls in Modern Language Models

    May 14, 2026Mahdi Naser Moghadasi, Faezeh GhaderiTransformer InferenceTransformer Attention

  22. ASAP: Amortized Doubly-Stochastic Attention via Sliced Dual Projection

    May 13, 2026Huy Tran, Max Milkert, David HydeTransformer InferenceSelf-Attention

  23. KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

    May 12, 2026Alireza Nadali, Patrick Cooper, Ashutosh Trivedi +1Transformer InferenceKV Caching