Linear Attention

Momentum

10 papers in the last four weeks, up 43% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

    Jul 21, 2026Jiahong Zhang, Yifan Lin, Yandong Zhang +6Robot NavigationLinear Attention

  2. Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones

    Jul 19, 2026Ayoub Ghriss, Sourav ChakrabortyEfficient AttentionLinear Attention

  3. SpecLA: Efficient Speculative Decoding for Linear-Attention Models

    Jul 18, 2026Zhibin Wang, Xuying Han, Zhaohua Yang +5Speculative DecodingLLM Inference Acceleration

  4. EMAGN: Efficient Multi-Attention Graph Network via Learned Clustering for Scalable Traffic Forecasting

    Jul 14, 2026Mingxing Xu, Rakesh Chowdary Machineni, Ke Liu +7Efficient Neural Network InferenceGraph Attention Networks

  5. Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

    Jul 8, 2026Tommaso Cerruti, Tim Rieder, George Rowlands +2Linear AttentionDelta-Rule Linear Attention

  6. LLT: Local Linear Transformer for PDE Operator Learning

    Jul 4, 2026Oded Ovadia, Eli TurkelPDE Surrogate ModelingTransformer Attention

  7. ELiTeFormer: An Efficient Transformer for FPGAs

    Jul 4, 2026Victor Agostinelli, Nicolas Bohm Agostini, Antonino TumeoLLM QuantizationTernary Quantization

  8. Self-Gating Attention for Efficient Time Series Forecasting

    Jul 2, 2026Dezheng Wang, Tong Chen, Wei Yuan +3Time Series ForecastingLinear Attention

  9. Ghost in the Kernel: In-Context Learning with Efficient Transformers via Domain Generalization

    Jul 1, 2026Peilin Liu, Ding-Xuan ZhouLinear AttentionIn-Context Learning

  10. Flexformer: Flexible Linear Transformer with Learnable Attention Kernel

    Jun 26, 2026Haoran Zhang, Feng ZhouFourier Feature EmbeddingsLong-Context Language Modeling

  11. Erase-then-Delta Attention: Decoupling Erase and Write Addresses in Delta-Rule Linear Attention

    Jun 25, 2026Xiao Li, Chengruidong Zhang, Hao Luo +15Memory-Augmented Language ModelsLong-Context Language Modeling

  12. Enhancing Layer Interaction Using Key-Correlated Layer Attention

    Jun 24, 2026Jianlong Xiong, ChuanBo Xie, Le Yu +2Efficient AttentionLinear Attention

  13. LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching

    Jun 24, 2026Yiran Wang, Oliver Turner, Viorela IlaMulti-Scale Feature FusionStereo Matching

  14. TuringViT: Making SOTA Vision Transformers Accessible to All

    Jun 23, 2026Qiman Wu, Hanlin Chen, Lyujie Chen +19Vision Foundation ModelsVision Transformer

  15. When Does Depth Matter For In-Context Learning? Adaptive Inference in Deep Transformers

    Jun 15, 2026Ravin Raj, Gautam ReddyTransformer InterpretabilityAdaptive Inference

  16. Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation

    Jun 15, 2026Zhongzhu Zhou, Qingyang Wu, Junxiong Wang +4Neural Network InitializationLinear Attention

  17. Dynamic Linear Attention

    Jun 9, 2026Xin Wang, Hui Shen, Boyuan Zheng +7Long-Context Language ModelingLinear Attention

  18. Q-Delta: Beyond Key-Value Associative State Evolution

    Jun 7, 2026Sumin Park, Seojin Kim, Noseong ParkLinear AttentionDelta-Rule Linear Attention

  19. When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

    Jun 4, 2026Luoming Zhang, Yuwei Ren, Kui Zhang +7Efficient Transformer InferenceLLM Inference Acceleration

  20. SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks

    Jun 3, 2026Zhuang Zhuang, Zhipeng Wei, Ji Dai +4Memory-Augmented Neural NetworksSequential Recommendation

  21. Blurry Window Attention

    May 31, 2026Axel Laborieux, Christos Sourmpis, Juan Gabriel Kostelec +1Long-Context Language ModelingLinear Attention

  22. Don't Read Everything: A Curvature-Conditioned Query for Linear Attention

    May 31, 2026Dong Le, Thong Nguyen, Cong-Duy Nguyen +1In-Context RetrievalLong-Context Language Modeling

  23. Parallax: Parameterized Local Linear Attention for Language Modeling

    May 27, 2026Yifei Zuo, Dhruv Pai, Zhichen Zeng +3Language Model PretrainingSelf-Attention

  24. Interdomain Attention: Beyond Token-Level Key-Value Memory

    May 23, 2026Naoki Kiyohara, Harrison Bo Hua Zhu, Riccardo El Hassanin +4Self-AttentionLong-Context Language Modeling