Attention Mechanisms

Momentum

42 papers in the last four weeks, up 100% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 378

All topics
CardsList
  1. Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation

    Jun 15, 2026Zhongzhu Zhou, Qingyang Wu, Junxiong Wang +4Neural Network InitializationLinear Attention

  2. QK-Normed MLA: QK normalization without full key caching

    Jun 15, 2026Yizhou Han, Yao Zhao, Jun Zhou +2KV CachingTransformer Attention

  3. Rethinking the Role of Efficient Attention in Hybrid Architectures

    Jun 13, 2026Ziqing Qiao, Yinuo Xu, Chaojun Xiao +6Attention Head AnalysisLong-Context Modeling

  4. Zero-shot generalization of transformer neural operators to larger domains

    Jun 12, 2026Armand de Villeroché, Sibo Cheng, Vincent Le Guen +5Local AttentionPDE Operator Learning

  5. WAM4D: Fast 4D World Action Model via Spatial Register Tokens

    Jun 12, 2026Ying Li, Xiaobao Wei, Jiajun Cao +10World Models for RoboticsRobotic Manipulation

  6. Context-Guided Semantic Alignment for Feature Fusion Networks

    Jun 12, 2026Hyungseop Lee, Jiho Lee, Woochul KangMulti-Scale Feature FusionObject Detection

  7. YOLO-AMC: An Improved YOLO Architecture with Attention Mechanisms for Building Crack Detection

    Jun 11, 2026Ching-Yu Tsai, Chia-Min Lin, Chih-Hsiang Yang +2Object DetectionAttention Mechanisms

  8. LASA: A Weak Supervision Method for Open-Vocabulary Scene Sketch Semantic Segmentation

    Jun 10, 2026Liwen Yi, Xianlin Zhang, Yue Zhang +2Weakly Supervised Image SegmentationWeakly Supervised Semantic Segmentation

  9. Boltzmann Attention: Learnable Ising Couplings for Cooperative Attention

    Jun 10, 2026Gilhan Kim, Daniel K. ParkQuantum AnnealingIsing Model

  10. Express Language Modeling

    Jun 9, 2026Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi +1Long-Context Language Model InferenceAttention Mechanisms

  11. Attention Expansion: Enhancing Keyphrase Extraction from Long Documents with Attention-Augmented Contextualized Embeddings

    Jun 9, 2026Roberto Martínez-Cruz, Alvaro J. López-López, José PortelaDocument Information ExtractionLong-Context Modeling

  12. Overcoming Decoder Inconsistencies in Whisper for Dravidian and Low-Resource Languages

    Jun 8, 2026Chowdam Venkata Kumar, Kumud Tripathi, Pankaj WasnikAttention MechanismsLow-Resource Language Processing

  13. Hasse Diagrams for Attention: A Partial Order Framework for Designing Transformer Masks

    Jun 8, 2026Chentao Li, Han GuoTransformer AttentionAttention Mechanisms

  14. Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

    Jun 8, 2026Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont +1Vision TransformerEfficient ViTs

  15. OmniGen-AR: AutoRegressive Any-to-Image Generation

    Jun 8, 2026Junke Wang, Xun Wang, Qiushan Guo +4Conditional Image GenerationImage Generation

  16. Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning

    Jun 7, 2026Chiradeep Ghosh, Dakshina Ranjan KiskuImage CaptioningVision Transformer

  17. TabSwift: An Efficient Tabular Foundation Model with Row-Wise Attention

    Jun 5, 2026Si-Yang Liu, Han-Jia YeTabular Foundation ModelsEfficient Inference

  18. Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

    Jun 5, 2026Xiang Yang, Feifei Li, Mi Zhang +4Diffusion TransformerImage Generation

  19. Multi-Scale Feature Attention Network for Polymer Classification Using Terahertz Spectroscopy

    Jun 4, 2026Roshni Mahtani, Ilán Carretero, Laura Monroy +3Multi-Scale Feature FusionMaterials Science

  20. High-Dimensional Theory of LoRA Fine-Tuning in a Solvable Attention Model

    Jun 4, 2026O. Duranthon, F. Boncoraglio, L. ZdeborováFine-TuningLow-Rank Adaptation

  21. Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

    Jun 3, 2026Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh AfghahEfficient Multimodal InferenceMultimodal ICL

  22. Do Transformers Need Three Projections? Systematic Study of QKV Variants

    Jun 1, 2026Ali Kayyam, Anusha Madan Gopal, M Anthony LewisEfficient Transformer InferenceTransformer Attention

  23. Attention Calibration for Position-Fair Dense Retrieval

    Jun 1, 2026Andrianos Michail, Elias Schuhmacher, Juri Opitz +2Information RetrievalAttention Mechanisms

  24. Quantifying and Mitigating Domain Shift in Peach Leaf Damage Classification: Attention Mechanisms and Fine-Tuning Strategies

    Jun 1, 2026Adrián Cánovas-Rodriguez, Miguel A. González-Illán, Maria Fernanda García-Cruz +5Agricultural Image AnalysisFine-Tuning

  25. Blurry Window Attention

    May 31, 2026Axel Laborieux, Christos Sourmpis, Juan Gabriel Kostelec +1Long-Context Language ModelingLinear Attention