Linear Attention

Momentum

10 papers in the last four weeks, up 43% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. What can linear attention learn from nonlinear teachers in-context?

    Oct 7, 2026Mary Letey, Arman Rysmakhanov, Yue M. Lu +2In-Context LearningLinear Attention

  2. Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

    Oct 7, 2026Xiaoran Liu, Ziwei He, Xipeng QiuLong-Context Language ModelingHybrid Attention

  3. PHBA: Prefix-State Hybrid Block Attention

    Oct 6, 2026Ruijie Li, Jiaxi Hu, Shiyu Wang +1Long-Context ModelingLinear Attention

  4. HLA: Expressive Hybrid Linear Attention via Chunk-Wise Dynamic Mixing

    Oct 5, 2026Zhuokun Chen, Xi Lin, Xiyu Wu +3Long-Context Language ModelingLinear Attention

  5. HLA-WM: Hybrid Linear Attention for Long-Horizon Video World Models

    Oct 5, 2026Zhuokun Chen, Feng Chen, Xi Lin +4World Model LearningLong-Horizon Video Generation

  6. Switching Linear Attention

    Sep 30, 2026Hyun Dong Lee, Xavier Gonzalez, Nicolas Zucchet +3Efficient AttentionLinear Attention

  7. SMat-Attention: Structured Long-Context Sequence Modeling

    Sep 28, 2026Emile Anand, Abdullah Ateyeh, Archer Wang +1Long-Context ModelingLinear Attention

  8. MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution

    Sep 28, 2026Prasoon Dev, Anirudh Sankar, Vasudeva VarmaLong-Context Language ModelingGated Attention

  9. SketchSSM: Write to the Full State, Read from a Compact Sketch

    Sep 27, 2026Omin Kwon, JoongWon Shin, Minseo Kim +3LLM Inference AccelerationLinear Attention

  10. GTR: Gated Token Recurrence for Efficient Dense Prediction

    Sep 22, 2026Zhe Feng, Longfei Liu, Wei Liu +7Efficient Neural Network InferenceGated Attention

  11. Rethinking Vision Architectures with Gated Linear Attention and KAN

    Sep 18, 2026Ali Mehizel, Oussama KhaldiVisual Representation LearningVision Transformer

  12. Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

    Sep 17, 2026Haocheng Xi, Yiming Xie, Hexu Zhao +8Video Diffusion ModelsStreaming Video Generation

  13. OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation

    Sep 14, 2026Xiangrui Yang, Cheng Peng, Yunfeng Zhao +9Linear AttentionAutoregressive Decoding

  14. Kalman Delta Networks: Uncertainty-aware Associative Memory

    Sep 7, 2026Ngoc Bui, Tinglin Huang, Rex YingMemory-Augmented Neural NetworksLinear Attention

  15. RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers

    Sep 6, 2026Zekun Zhang, Yixiang Cai, Yuxi Liu +9Rotary Positional EmbeddingsLow-Rank Attention

  16. Modern Transformers Are Implicit Hybrids: From Functional Differentiation to Principled Hybrid Architecture Design

    Sep 2, 2026Runlin Shi, Bojian Yin, Guoqi LiRotary Positional EmbeddingsLinear Attention

  17. Liquid Gated Attention

    Aug 31, 2026Yiheng Jiang, Yuanbo Xu, Yongjian YangGated AttentionLinear Attention

  18. Sliding-window beats linear attention

    Aug 28, 2026Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron +1KV CachingLLM Inference Acceleration

  19. Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

    Aug 12, 2026Zunhai Su, Bohan Sun, Xialie Zhuang +8Linear AttentionHybrid Attention

  20. MixFormer: Linear Transformer with Mixture of Memory Experts

    Aug 10, 2026Yu Guo, Lei DuanMemory-Augmented Neural NetworksTransformer

  21. Linearized 2-Simplicial Attention

    Aug 10, 2026Aritra Das, Dhruman Gupta, Debayan GuptaLinear AttentionAttention Mechanisms

  22. HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

    Aug 7, 2026Dong Liu, Yanxuan Yu, Renata Borovica-Gajic +2Efficient ViTsLinear Attention

  23. Retrofitting Linear Attention into Diffusion Language Models

    Aug 6, 2026Jinha Kim, Younghun Roh, Jaeyeon KimBlockwise Diffusion Language ModelsDiffusion Language Model Inference

  24. A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion

    Aug 4, 2026Yiming Gong, Kai WangLinear AttentionMicroscopy Image Analysis

  25. Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

    Aug 3, 2026Li Wang, Yi Su, Xiabao Wu +9Speculative DecodingLLM Inference Acceleration

  26. Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

    Aug 3, 2026Ashfak Yeafi, Mehedi Hasan, Md Khairul IslamMemory-Augmented VLMsVision-Language Models

  27. Indexing: the Beginning and the End

    Jul 24, 2026Alexander Kozachinskiy, Vicente Opazo, Felipe UrrutiaInformation BottleneckLinear Attention