Linear Attention

Momentum

25 papers in the last four weeks, up 92% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 183

All topics
CardsList
  1. In-context Learning of Single-index Targets: Comparing Kernel and Feature Learners

    Oct 1, 2026Haotian Gu, Yizhou Xu, Lenka ZdeborováIn-Context LearningLinear Attention

  2. Switching Linear Attention

    Sep 30, 2026Hyun Dong Lee, Xavier Gonzalez, Nicolas Zucchet +3Kimi Delta AttentionLinear Attention

  3. Retrieval Capacity of Self-Attention Under Competition

    Sep 29, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateLinear AttentionCompetition

  4. SMat-Attention: Structured Long-Context Sequence Modeling

    Sep 28, 2026Emile Anand, Abdullah Ateyeh, Archer Wang +1Linear AttentionSequence Modeling

  5. MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution

    Sep 28, 2026Prasoon Dev, Anirudh Sankar, Vasudeva VarmaLinear AttentionMulti-Scale Attention

  6. Late Attention Layers Alone Can Copy Entity Tokens, but Not Without Attending to Their Context

    Sep 28, 2026Muyu He, Yuchen Liu, Ran Tao +1Compact Latent Sensor TokensLinear Attention

  7. CoDrive: Cross-Vehicle World-Consistent Video Generation with Precise Trajectory Control for Cooperative Driving

    Sep 28, 2026Yu Meng, Baining Zhao, Junta Wu +10DrivesCamera Trajectories

  8. WorldAttention: An Efficient Attention Architecture for Interactive Video World Models

    Sep 28, 2026Zeyu Zhang, Jinyuan Mao, Dakai An +6Video World ModelsDynamic Sparse Attention

  9. DORA: Dynamic Online Reinforcement Agent for Token Pruning in Vision Transformers

    Sep 28, 2026Kaixuan He, Song Chen, Yi KangVisual Token PruningVision Transformer

  10. SchemaMem: Schema-Indexed Recurrent Memory for Delayed State Retrieval

    Sep 27, 2026Sungwoo Goo, Hwi-yeol Yun, Sangkeun JungRecurrent ModelPersistent State

  11. NS-ATTENTION: Newton-Schulz Transformations of Attention Outputs in Vision Transformers

    Sep 23, 2026Xiaohe Jiang, Guoqiang Zhang, Tianjin Huang +1Transformer AttentionLinear Attention

  12. DeltaS: Reading the Gated Linear Attention State for KV Cache Eviction in Streaming Video

    Sep 23, 2026Taeyoun Kwon, Seungjin Kim, Hyeonyu Kim +1Kimi Delta AttentionLinear Attention

  13. Opinion Leader Dynamics: How Sparse Attention Shapes Token Clustering

    Sep 21, 2026Jingkun Liu, Yue SongLinear AttentionAttractors

  14. Increasing Skill Level Recruits Deeper Attention Layers in a Frozen Chess Transformer

    Sep 20, 2026David LitmanChessTransformer Attention

  15. Rethinking Vision Architectures with Gated Linear Attention and KAN

    Sep 18, 2026Ali Mehizel, Oussama KhaldiVision TransformerVision Foundation Models

  16. Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

    Sep 17, 2026Haocheng Xi, Yiming Xie, Hexu Zhao +8Video Diffusion ModelsVideo Generation

  17. The Attention Within: Consensus Dynamics in Selective State Space Models

    Sep 16, 2026João Pedro Silvestre, Álvaro Rodríguez Abella, Paulo TabuadaTransformer AttentionState Space Models

  18. VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

    Sep 14, 2026Xingyang Li, Dongyun Zou, Shining Zhang +8Linear AttentionVideo Generation

  19. Rethinking Heterogeneous System Disaggregation for Subquadratic Attention

    Sep 14, 2026Arya Tschand, Yaosheng Fu, Vikram Sharma Mailthody +6Linear AttentionGraphics Processing Unit Memory

  20. OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation

    Sep 14, 2026Xiangrui Yang, Cheng Peng, Yunfeng Zhao +9Kimi Delta AttentionLinear Attention

  21. ProbPlug: A Plugin Uncertainty Network for Reliable Confidence in LLM Binary Classification

    Sep 9, 2026Jianzong Wang, Chuhang Liu, Botao Zhao +6Confidence EstimationConfidence Calibration

  22. Why shared attention vectors fail: a case for outcome-indexed tuning

    Sep 8, 2026Lenard DomeAttention LayersLinear Attention

  23. Kalman Delta Networks: Uncertainty-aware Associative Memory

    Sep 7, 2026Ngoc Bui, Tinglin Huang, Rex YingKimi Delta AttentionLinear Attention

  24. RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers

    Sep 6, 2026Zekun Zhang, Yixiang Cai, Yuxi Liu +9Video Diffusion ModelsSpatio-Temporal Attention

  25. Modern Transformers Are Implicit Hybrids: From Functional Differentiation to Principled Hybrid Architecture Design

    Sep 2, 2026Runlin Shi, Bojian Yin, Guoqi LiRotary Position EmbeddingTransformer Architectures

  26. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4Efficient Long-Context InferenceKey-Value Cache

  27. Visual Attention Faithfulness in Vision-Language Models is Heterogeneous

    Sep 1, 2026Xurui Song, Weishi Wang, Zhongqi Yue +5Long Visual-Token SequencesFaithfulness

  28. Can Video World Models Track Unobserved World States?

    Aug 31, 2026Joonghyuk Shin, Yicong Hong, Jaesik Park +1Video World ModelsHidden States

  29. Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

    Aug 31, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +2Kimi Delta AttentionLinear Attention

  30. ConCA: Concentration-Aware Channel Attention for Fine-Grained Visual Recognition

    Aug 31, 2026Yu-Sheng Liu, Yu-Chen TungConvolutional Block Attention ModuleFine-Grained Perception

  31. Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

    Aug 31, 2026Bingde Liu, Wu Ran, Jinglei Zhang +2Depth EstimationVisual Fidelity

  32. Ask Self, Ask Others: Relation Is All You Need

    Aug 20, 2026Yuting Ge, Pengju Yang, Mingkai NieLinear AttentionBlock Sparse Flash Attention

  33. Clustered Attractor Manifolds and Dynamical Condensation in Self-Attention

    Aug 9, 2026Qucheng Gao, Zuyi Yang, Xiao ChenAttractorsLinear Attention

  34. Gated Spatial Redundancy Projection for Pathology Transformer Attentions

    Aug 8, 2026Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh +1Computational PathologyWhole-Slide Images

  35. Faster Query-Key Learning Sharpens Attention in Self-Attention Models

    Aug 7, 2026Rahul Vashisht, Harish G. RamaswamyLinear AttentionInterpretability

  36. HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

    Aug 7, 2026Dong Liu, Yanxuan Yu, Renata Borovica-Gajic +2Self-Supervised Vision TransformersVision Transformer

  37. Retrofitting Linear Attention into Diffusion Language Models

    Aug 6, 2026Jinha Kim, Younghun Roh, Jaeyeon KimDiffusion Language ModelsKimi Delta Attention

  38. GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification

    Aug 6, 2026Yunping Shi, En Yu, Kairui Guo +1Multimodal ClassificationCounterfactual Learning

  39. AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

    Aug 5, 2026Chengyu Qiu, Xiao Fu, Fengcun Li +6Hardware EfficiencyTime-To-First-Token

  40. Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

    Aug 3, 2026Cunchen Hu, Liangliang Xu, Tian Liu +9Graphics Processing Unit ResourcesRate Scaling

  41. AdaHAT: Adaptive Hard Attention to the Task in Task-Incremental Learning

    Aug 2, 2026Pengxiang Wang, Hongbo Bo, Jun Hong +2Class-Incremental LearningCatastrophic Forgetting

  42. How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

    Jul 28, 2026Ramtin Ehsani, Irene Manotas, Saurabh Pujar +2Automated Program RepairBug

  43. What Softmax Throws Away: Mass-Aware Attention for Evidence Accumulation

    Jul 24, 2026Minwoo Yu, Young-guk HaLinear AttentionTemporal Graph Neural Networks

  44. Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

    Jul 21, 2026Jiahong Zhang, Yifan Lin, Yandong Zhang +6Vision-Language NavigationNavigation

  45. Norm or Direction? Decoding Vision Mambas for High-Resolution Vision

    Jul 21, 2026Jin Yu, Juyoun ParkMamba-Based ModelsVision State Space Models

  46. On the Diverse Dynamical Behaviors Arising in Deep Linear Transformers

    Jul 20, 2026Sixu Li, Thomas Jacob Maranzatto, Jan Peszek +5Transformer ArchitecturesLinear Attention

  47. Convolution for Large Language Models

    Jul 20, 2026Yuchuan Tian, Yingte Shu, Wei He +7Linear AttentionConvolutional

  48. Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones

    Jul 19, 2026Ayoub Ghriss, Sourav ChakrabortyKimi Delta AttentionLinear Attention

  49. AVQ-Attention: Adaptive Vector-Quantized Attention

    Jul 14, 2026Winfried van den dool, Patrick Forré, Amir Habibian +2Residual Vector QuantizationLinear Attention

  50. Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

    Jul 12, 2026Xiyan Su, Frank Diermeyer, Markus LienkampVideo World ModelsWorld Models