Efficient Attention

Momentum

15 papers in the last four weeks, up 114% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 96

All topics
CardsList
  1. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  2. Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones

    Jul 19, 2026Ayoub Ghriss, Sourav ChakrabortyEfficient AttentionLinear Attention

  3. DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

    Jul 17, 2026Yuyang Chen, Runxin Zhong, Zan Zong +3Diffusion TransformerEfficient Attention

  4. VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

    Jul 16, 2026Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu +3Efficient ViTsEfficient Attention

  5. AVQ-Attention: Adaptive Vector-Quantized Attention

    Jul 14, 2026Winfried van den dool, Patrick Forré, Amir Habibian +2Transformer AttentionVector Quantization

  6. FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

    Jul 13, 2026Wenzong Yang, Danyang Zhang, Kun Cao +17AI Accelerator InferenceLLM Inference

  7. STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

    Jul 10, 2026Victor J. B. Jung, Gagandeep Singh, Joseph Melber +3Efficient Transformer InferenceEnergy-Efficient ML

  8. Morphing into Hybrid Attention Models

    Jun 29, 2026Disen Lan, Jianbin Zheng, Yuxi Ren +5Efficient AttentionNeural Architecture Search

  9. Hierarchical Global Attention (HGA)

    Jun 29, 2026Woernle Frank, Fedosov Vladimir, Grinenko ArtemiyKV-Cache OffloadingLong-Context Modeling

  10. Enhancing Layer Interaction Using Key-Correlated Layer Attention

    Jun 24, 2026Jianlong Xiong, ChuanBo Xie, Le Yu +2Efficient AttentionLinear Attention

  11. Scalable Peptide Design via Memory-Efficient Equivariant Transformer

    Jun 23, 2026Rui Jiao, Xiangzhe Kong, Yinjun Jia +4Equivariant Neural NetworksEfficient Attention

  12. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

    Jun 20, 2026Xin GaoTransformer InferenceKV Caching

  13. CSWinUNETR: Segmentation of Thin Anatomical Structures in Medical Images

    Jun 18, 2026Junho Moon, Haejun Chung, Ikbeom JangHybrid CNN-Transformer ArchitecturesEfficient Attention

  14. Rethinking the Role of Efficient Attention in Hybrid Architectures

    Jun 13, 2026Ziqing Qiao, Yinuo Xu, Chaojun Xiao +6Attention Head AnalysisLong-Context Modeling

  15. MiniMax Sparse Attention

    Jun 11, 2026Xunhao Lai, Weiqi Xu, Yufeng Yang +14GPU Kernel OptimizationLong-Context Language Modeling

  16. Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

    Jun 8, 2026Yuxuan Chen, Haoyuan Yu, Peize HeCross-AttentionAudio Diffusion Models

  17. Attention at the Theoretical Minimum: A Mathematics of Arrays Framework for Memory-Optimal Transformer Kernels

    Jun 5, 2026Lenore Mullin, Gaetan HainsGPU Kernel OptimizationEnergy-Efficient ML

  18. Towards Tight Bounds for Streaming Attention

    Jun 5, 2026Justin Y. Chen, Ying Feng, Piotr Indyk +3Efficient AttentionKV-Cache Compression

  19. Do Transformers Need Three Projections? Systematic Study of QKV Variants

    Jun 1, 2026Ali Kayyam, Anusha Madan Gopal, M Anthony LewisEfficient Transformer InferenceTransformer Attention

  20. Interdomain Attention: Beyond Token-Level Key-Value Memory

    May 23, 2026Naoki Kiyohara, Harrison Bo Hua Zhu, Riccardo El Hassanin +4Self-AttentionLong-Context Language Modeling

  21. Approaching I/O-optimality for Approximate Attention

    May 22, 2026Pál András Papp, Aleksandros Sobczyk, Anastasios ZouziasSelf-AttentionEfficient Attention

  22. Preisach Attention: A Hysteretic Model of Sequential Memory

    May 22, 2026Piotr FrydrychTransformerEfficient Attention

  23. Structured-Sparse Attention for Entity Tracking with Subquadratic Sequence Complexity

    May 21, 2026Hangyue Zhao, Paul Caillon, Erwan Fagnou +1Self-AttentionStructured Sparsity