Attention Mechanisms

Momentum

42 papers in the last four weeks, up 100% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 378

All topics
CardsList
  1. Kwai Summary Attention Technical Report

    Apr 27, 2026Chenglong Chu, Guorui Zhou, Guowang Zhang +35Self-AttentionKV Caching

  2. Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

    Apr 27, 2026Amogh Sheth, Biruk Assefa, Yi Wen Huang +2LLM PruningSelf-Attention

  3. ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

    Apr 26, 2026Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao +1Efficient Transformer InferenceSoftmax Attention

  4. HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

    Apr 26, 2026Peize He, Yaodi Luo, Xiaoqian Liu +7Audio Token CompressionSelf-Attention

  5. Rank, Head-Channel Non-Identifiability, and Symmetry Breaking: A Precise Analysis of Representational Collapse in Transformers

    Apr 26, 2026Giansalvo CirrincioneTransformer InterpretabilityRepresentation Collapse

  6. Different Strokes for Different Folks: Writer Identification for Historical Arabic Manuscripts

    Apr 24, 2026Hamza A. Abushahla, Ariel Justine N. Panopio, Layth Al-Khairulla +1Document UnderstandingHistorical Document Analysis

  7. HubRouter: A Pluggable Sub-Quadratic Routing Primitive for Hybrid Sequence Models

    Apr 24, 2026Abhinaba BasuTransformer AttentionLanguage Modeling

  8. Dissociating Decodability and Causal Use in Bracket-Sequence Transformers

    Apr 24, 2026Aryan Sharma, Cutter Dawes, Shivam RavalTransformer InterpretabilitySelf-Attention

  9. Shared Lexical Task Representations Explain Behavioral Variability In LLMs

    Apr 23, 2026Zhuonan Yang, Jacob Xiaochen Li, Francisco Piedrahita Velez +5Prompt SensitivityLLM Prompting

  10. Evaluating Post-hoc Explanations of the Transformer-based Genome Language Model DNABERT-2

    Apr 23, 2026Isabel Kurth, Paulo Yanez Sarmiento, Bernhard Y. RenardTransformer InterpretabilityAttention Mechanisms

  11. The Recurrent Transformer: Greater Effective Depth and Efficient Decoding

    Apr 23, 2026Costin-Andrei Oncescu, Depen Morwani, Samy Jelassi +3Efficient Transformer InferenceSelf-Attention

  12. Attention-Augmented YOLOv8 with Ghost Convolution for Real-Time Vehicle Detection in Intelligent Transportation Systems

    Apr 22, 2026Syed Sajid Ullah, Muhammad Zunair Zamir, Ahsan Ishfaq +1Intelligent Transportation SystemsObject Detection

  13. Simplified Sparse Attention via Gist Tokens

    Apr 22, 2026Yuzhen Mao, Michael Y. Li, Emily B. FoxSelf-AttentionLong-Context Language Model Inference

  14. Tracing Relational Knowledge Recall in Large Language Models

    Apr 21, 2026Nicholas Popovič, Michael FärberLinear ProbingFactual Knowledge in Language Models

  15. Super Apriel: One Checkpoint, Many Speeds

    Apr 21, 2026SLAM Labs, :, Oleksiy Ostapenko +13LLM Inference AccelerationAttention Mechanisms

  16. Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling

    Apr 21, 2026Weijie Zhao, Mingquan Liu, Bolun Wang +4TransformerLanguage Model Scaling Laws

  17. DeltaSeg: Tiered Attention and Deep Delta Learning for Multi-Class Structural Defect Segmentation

    Apr 20, 2026Enrique Hernandez Noguera, Md Meftahul Ferdaus, Elias Ioup +1Attention MechanismsSemantic Segmentation

  18. Attention-ResUNet for Automated Fetal Head Segmentation

    Apr 20, 2026Ammar Bhilwarawala, Mainak BandyopadhyayUltrasound Image SegmentationMedical Image Segmentation

  19. Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

    Apr 20, 2026Yujie Chen, Tailai Chen, Yifeng Gao +4Self-AttentionLong-Context Language Model Inference

  20. DSAINet: An Efficient Dual-Scale Attentive Interaction Network for General EEG Decoding

    Apr 20, 2026Zhiyuan Ma, Zeyuan Li, Zihao Qiu +6Cross-Subject EEG DecodingEEG Decoding

  21. HeadRank: Decoding-Free Passage Reranking via Preference-Aligned Attention Heads

    Apr 19, 2026Juyuan Wang, Chenxing Wang, Yuchen Fang +8Attention Head AnalysisSelf-Attention