Attention Mechanisms

Momentum

42 papers in the last four weeks, up 100% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 378

All topics
CardsList
  1. Compressed Sensing for Capability Localization in Large Language Models

    Feb 11, 2026Anna Bair, Yixuan Even Xu, Mingjie Sun +1Attention Head AnalysisLLM Interpretability

  2. FGAA-FPN: Foreground-Guided Angle-Aware Feature Pyramid Network for Oriented Object Detection

    Feb 11, 2026Jialin MaMulti-Scale Feature FusionObject Detection

  3. Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference

    Feb 9, 2026Yifei Gao, Lei Wang, Rong-Cheng Tu +3Self-AttentionKV Caching

  4. ResidualKV: Residual-Based KV Cache Compression for Efficient Long-Context Inference

    Feb 8, 2026Jitai Hao, Qiang Huang, Yaowei Wang +2Self-AttentionKV Caching

  5. Quantum Attention by Overlap Interference: Predicting Classical and Many-Body Quantum Sequences

    Feb 6, 2026Alessio Pecilli, Matteo RosatiSelf-AttentionTransformer Attention

  6. FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

    Feb 5, 2026Zhuokun Chen, Jianfei Cai, Bohan ZhuangVideo Diffusion ModelsSelf-Attention

  7. Poly-attention: a general scheme for higher-order self-attention

    Feb 2, 2026Sayak Chakrabarti, Toniann Pitassi, Josh AlmanSelf-AttentionCompositional Reasoning

  8. STILL: Selecting Tokens for Intra-Layer Hybrid Attention to Linearize LLMs

    Feb 2, 2026Weikang Meng, Liangyu Huo, Yadan Luo +4LLM Inference AccelerationLinear Attention

  9. Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching

    Jan 28, 2026Fengrui Zuo, Zhiwei Ke, Yiming Liu +3Diffusion Language Model InferenceToken Pruning

  10. RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

    Jan 21, 2026Yu Wu, Minsik Jeon, Jen-Hao Rick Chang +2Multi-View 3D ReconstructionNovel View Synthesis

  11. Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling

    Jan 17, 2026Xingyue Huang, Xueying Ding, Mingxuan Ju +3Self-AttentionLong-Context Language Modeling

  12. Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning

    Jan 11, 2026Jaewon Sok, Jewon Yeom, Seonghyeon Park +2LLM PruningAttention Head Analysis

  13. Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

    Dec 18, 2025Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra +1Self-AttentionLong-Context Language Model Inference

  14. Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics

    Dec 14, 2025Jingdi Lei, Di Zhang, Soujanya PoriaDynamical SystemsLinear Attention

  15. Block Sparse Flash Attention

    Dec 7, 2025Daniel Ohayon, Itay Lamprecht, Itay Hubara +3GPU AccelerationSelf-Attention

  16. Data-Free Pruning of Self-Attention Layers in LLMs

    Dec 3, 2025Dhananjay Saikumar, Blesson VargheseLLM PruningLLM Compression

  17. Selective Rotary Position Embedding

    Nov 21, 2025Sajad Movahedi, Timur Carstensen, Arshia Afzal +3Softmax AttentionRotary Positional Embeddings

  18. Predicting the Emergence of Induction Heads in Language Model Pretraining

    Nov 21, 2025Tatsuya Aoyama, Ethan Gotlieb Wilcox, Nathan SchneiderLanguage Model PretrainingIn-Context Learning

  19. Controllably Efficient Language Models

    Nov 7, 2025Jatin Prakash, Aahlad Puli, Rajesh RanganathEfficient Transformer InferenceLong-Context Language Modeling

  20. NOSA: Native and Offloadable Sparse Attention

    Oct 15, 2025Yuxiang Huang, Pengjie Wang, Jicheng Han +9KV-Cache OffloadingGPU Acceleration

  21. Performance-Efficiency Tradeoffs in Transformers: An Approximation Theory Perspective

    Oct 4, 2025Ruoxi Yu, Haotian Jiang, Jingpu Cheng +3Softmax AttentionAttention Head Analysis

  22. Accelerating Attention with Basis Decomposition

    Oct 2, 2025Jialin ZhaoSelf-AttentionTransformer Attention

  23. Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors

    Oct 1, 2025Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang +1Language Model SteeringRAG Poisoning Attacks

  24. RefAM: Attention Magnets for Zero-Shot Referral Segmentation

    Sep 26, 2025Anna Kukleva, Enis Simsar, Alessio Tonioni +4Zero-Shot LearningImage Segmentation

  25. Rotary Position Encodings for Graphs

    Sep 26, 2025Isaac Reid, Arijit Sehanobish, Cederik Höfs +7Rotary Positional EmbeddingsGraph Representation Learning

  26. Cross-Attention is Half Explanation in Speech-to-Text Models

    Sep 22, 2025Sara Papi, Dennis Fucci, Marco Gaido +2Transformer InterpretabilityCross-Attention