Efficient Attention

Momentum

15 papers in the last four weeks, up 114% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 96

All topics
CardsList
  1. Attention via Black-Box Vector Search

    Oct 7, 2026Stepan Zharkov, Krish Singal, Ashwin Padaki +1Efficient AttentionSparse Attention

  2. LampAttention: Look-Ahead Mixed-Precision FlashAttention for Dedicated Accelerators

    Sep 30, 2026Stanislav Budzinskiy, Marian Gloser, Tolunay Yilmaz +5AI Accelerator InferenceLLM Inference Acceleration

  3. Switching Linear Attention

    Sep 30, 2026Hyun Dong Lee, Xavier Gonzalez, Nicolas Zucchet +3Efficient AttentionLinear Attention

  4. SANTA++: Sampling Attention through Representative Keys

    Sep 28, 2026Kyle Lee, Christian Z. Pratt, Ruoyu Fang +4Memory-Efficient InferenceLLM Inference Acceleration

  5. When Can Attention Heads Be Statically Defined?

    Sep 28, 2026Weixian Waylon Li, Yintao Tai, Marcio Fonseca +1Attention Head AnalysisEfficient Attention

  6. Broken Symmetry in BF16 Attention: Why FlashAttention Gradients Blow Up Late in Training

    Sep 28, 2026Junlin Chen, Daize Dong, Huanwei Di +9Softmax AttentionEfficient Attention

  7. Benchmarking Attention for Tabular Foundation Models

    Sep 25, 2026Maximilian Schambach, Clemens Biehl, Sam ThelinTabular Foundation ModelsEfficient Attention

  8. Attention Routing Stabilizes Early: Working-Set Inference for Recurrent Language Models

    Sep 23, 2026Ke Wan, Chen ChenLong-Context Language Model InferenceRecurrent Transformers

  9. Rethinking Heterogeneous System Disaggregation for Subquadratic Attention

    Sep 14, 2026Arya Tschand, Yaosheng Fu, Vikram Sharma Mailthody +6Disaggregated LLM ServingLLM Inference Acceleration

  10. RouteRelay: Event-Triggered Cross-Layer Route Reuse for Efficient Dynamic Sparse Attention

    Sep 7, 2026Bin Li, Sisi Liu, Chenyang Hu +3Adaptive Model RoutingEfficient Attention

  11. CEDAR: Error-Bounded Residual Routing for Efficient Long-Context Attention

    Sep 7, 2026Siyu Li, Dong Wang, Jie Zhou +3Long-Context Language ModelingEfficient Attention

  12. ConCA: Concentration-Aware Channel Attention for Fine-Grained Visual Recognition

    Aug 31, 2026Yu-Sheng Liu, Yu-Chen TungChannel AttentionFine-Grained Image Classification

  13. Lapis: Laplacian Spiking Attention via First-Spike Timing and Membrane Leakage

    Aug 12, 2026Kaiwen Tang, Jiaqi Zheng, Zixuan Zhu +3Spiking TransformersEfficient Attention

  14. Hybrid Gated Attention

    Aug 12, 2026Zekun Zhou, Ruobing Xie, Lanrui Wang +1Low-Rank Matrix DecompositionGated Attention

  15. Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

    Aug 11, 2026Zelei Cheng, Amritansh Mishra, Sambit Sahu +1Efficient AttentionLong-Horizon Agent Tasks

  16. Training-Free Hashing-Based Attention via Binary Principal Components

    Aug 5, 2026Daohai Yu, Zhanpeng Zeng, Keyu Chen +6Long-Context Language ModelingLLM Inference Acceleration

  17. S-CEReBrO: Breaking the Memory Barrier in Continuous EEG Monitoring

    Jul 30, 2026Glenn Anta Bucagu, Thorir Mar Ingolfsson, Yawei Li +1Efficient Transformer InferenceElectroencephalography

  18. Recall Before You Rank: Similarity-Guided Top-KK Reuse for Efficient Long-Context Attention

    Jul 30, 2026Wenshuai Yao, Wenyong Zhou, Hanyong Shao +5Long-Context Language Model InferenceEfficient Attention

  19. A Coulomb Particle Model for Learning Kernel Attention in Transformers

    Jul 26, 2026Masoud Badiei Khuzani, Sharath Honnaiah, Atiq Islam +2Transformer AttentionEfficient Attention

  20. ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers

    Jul 22, 2026Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun MoonLow-Rank AttentionTransformer Attention

  21. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  22. Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones

    Jul 19, 2026Ayoub Ghriss, Sourav ChakrabortyEfficient AttentionLinear Attention

  23. DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

    Jul 17, 2026Yuyang Chen, Runxin Zhong, Zan Zong +3Diffusion TransformerEfficient Attention

  24. VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

    Jul 16, 2026Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu +3Efficient ViTsEfficient Attention

  25. AVQ-Attention: Adaptive Vector-Quantized Attention

    Jul 14, 2026Winfried van den dool, Patrick Forré, Amir Habibian +2Transformer AttentionVector Quantization

  26. FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

    Jul 13, 2026Wenzong Yang, Danyang Zhang, Kun Cao +17AI Accelerator InferenceLLM Inference

  27. STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

    Jul 10, 2026Victor J. B. Jung, Gagandeep Singh, Joseph Melber +3Efficient Transformer InferenceEnergy-Efficient ML

  28. Morphing into Hybrid Attention Models

    Jun 29, 2026Disen Lan, Jianbin Zheng, Yuxi Ren +5Efficient AttentionNeural Architecture Search

  29. Hierarchical Global Attention (HGA)

    Jun 29, 2026Woernle Frank, Fedosov Vladimir, Grinenko ArtemiyKV-Cache OffloadingLong-Context Modeling

  30. Enhancing Layer Interaction Using Key-Correlated Layer Attention

    Jun 24, 2026Jianlong Xiong, ChuanBo Xie, Le Yu +2Efficient AttentionLinear Attention

  31. Scalable Peptide Design via Memory-Efficient Equivariant Transformer

    Jun 23, 2026Rui Jiao, Xiangzhe Kong, Yinjun Jia +4Equivariant Neural NetworksEfficient Attention

  32. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

    Jun 20, 2026Xin GaoTransformer InferenceKV Caching

  33. CSWinUNETR: Segmentation of Thin Anatomical Structures in Medical Images

    Jun 18, 2026Junho Moon, Haejun Chung, Ikbeom JangHybrid CNN-Transformer ArchitecturesEfficient Attention

  34. Rethinking the Role of Efficient Attention in Hybrid Architectures

    Jun 13, 2026Ziqing Qiao, Yinuo Xu, Chaojun Xiao +6Attention Head AnalysisLong-Context Modeling

  35. MiniMax Sparse Attention

    Jun 11, 2026Xunhao Lai, Weiqi Xu, Yufeng Yang +14GPU Kernel OptimizationLong-Context Language Modeling

  36. Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

    Jun 8, 2026Yuxuan Chen, Haoyuan Yu, Peize HeCross-AttentionAudio Diffusion Models

  37. Attention at the Theoretical Minimum: A Mathematics of Arrays Framework for Memory-Optimal Transformer Kernels

    Jun 5, 2026Lenore Mullin, Gaetan HainsGPU Kernel OptimizationEnergy-Efficient ML

  38. Towards Tight Bounds for Streaming Attention

    Jun 5, 2026Justin Y. Chen, Ying Feng, Piotr Indyk +3Efficient AttentionKV-Cache Compression

  39. Do Transformers Need Three Projections? Systematic Study of QKV Variants

    Jun 1, 2026Ali Kayyam, Anusha Madan Gopal, M Anthony LewisEfficient Transformer InferenceTransformer Attention

  40. Interdomain Attention: Beyond Token-Level Key-Value Memory

    May 23, 2026Naoki Kiyohara, Harrison Bo Hua Zhu, Riccardo El Hassanin +4Self-AttentionLong-Context Language Modeling

  41. Approaching I/O-optimality for Approximate Attention

    May 22, 2026Pál András Papp, Aleksandros Sobczyk, Anastasios ZouziasSelf-AttentionEfficient Attention

  42. Preisach Attention: A Hysteretic Model of Sequential Memory

    May 22, 2026Piotr FrydrychTransformerEfficient Attention

  43. Structured-Sparse Attention for Entity Tracking with Subquadratic Sequence Complexity

    May 21, 2026Hangyue Zhao, Paul Caillon, Erwan Fagnou +1Self-AttentionStructured Sparsity